DeepSeek-V4:如何在本地运行
在你自己的设备上本地运行 DeepSeek-V4-Flash 和 DeepSeek-V4-Flash-0731!
DeepSeek-V4 和 DeepSeek-V4-Flash-0731 是 DeepSeek 推出的新开源权重模型。Flash 变体有 284B 参数(13B 激活),V4-Pro 有 1.6T 参数(49B 激活)。DeepSeek-V4-Flash-0731 是 7月31日 对 Flash 模型的更新,在其规模和 性能上超过 V4-Pro (预览版)。专为代码、智能体和聊天工作流设计,具有 100万上下文 窗口,在本指南中我们将向你展示如何使用-0731 在本地运行 DeepSeek-V4-Flash Unsloth Dynamic GGUF。
对于 无损的 DeepSeek,请使用 Q8(UD-Q8_K_XL),它只比 Q4( 大 7GB 。无损的 8 位 GGUF 为UD-Q4_K_XL)。 无损 8 位 GGUF 为 162 GB ,3 位为 103GB ,它可以运行在 110GB RAM 设备上. DeepSeek-V4-Flash-0731 在 Terminal Bench 2.1 上得分 82.7%,在 DeepSWE 上得分 54.4%,在 NL2Repo 上得分 54.2%。 DSpark 也已为 GGUF 启用,可实现最高 2 倍更快的解码速度!
8月6日:DSpark 已为 DeepSeek-V4-Flash-0731 启用——带来 1.5 倍到 1.9 倍更快的推理!DSpark 会在 Unsloth.
我们还改进了 DeepSeek-V4 聊天 jinja 模板,并测试了超过 4000 轮对话,与官方基线等价。
DeepSeek-V4-Flash-0731-GGUF (新)
📊 量化分析
我们的 UD-Q8_K_XL 量化是完全无损的。DeepSeek-V4-Flash 经过量化感知训练:官方检查点将其路由专家(模型的 96%)原生以 MXFP4 存储,其他部分以 FP8 或 BF16 存储。GGUF 的 MXFP4 正是这种格式,因此我们按位重新打包这些专家,而 FP8 则无舍入地反量化为 BF16。我们将每个张量都与官方 DeepSeek 权重进行了核对:1,328 个张量全部按位一致,并且在推理时保持无损(KL 散度约为 0,top token 一致率 100%)。
非-Unsloth DeepSeek-V4-Flash GGUF 是在没有这些路径的情况下转换的,因此与官方权重存在偏差。 UD-Q4_K_XL 保持相同的按位精确专家,仅将非专家张量(模型的 4%)量化为 Q8_0,因此其大小和质量都与 Q8 非常接近。

与官方权重相比,两个 Unsloth 量化版本都位于质量/大小前沿。UD-Q8_K_XL 是唯一的无损点。UD-Q4_K_XL 与其他社区 MXFP4 格式一致,并且比 Q4_K-experts 转换更准确,后者虽然更大,但 KL 散度达到 0.0
我们还发现,对某些张量使用 Q8_0 和 F16 也并非无损,而且情况会更糟,因为 DeepSeek 对 MXFP4 / FP8 的工作进行了 QAT,因此我们不得不直接将它们保留为 BF16。所以请使用 UD-Q8_K_XL 作为真正的无损量化,而 UD-Q4_K_XL 会将部分 BF16 项降为 Q8_0。