跳转至

📄 文章总结:《速度太快了!本地可以跑 DeepSeek-V4-Flash 了》

公众号: cxuanAI | 分类: LLM | 收录日期: 2026-08-11 原链接: https://mp.weixin.qq.com/s/wsuqA83ThTrHIwlwUZZAHQ


DeepSeek-V4-Flash 本地运行指南:结构化总结

一、发布背景与本地运行消息

  • DeepSeek-V4-Flash 一经发布非常炸裂,发布后 1-4 小时,DeepSeek 响应速度明显变慢,作者估计大家都在接入 API 测试。
  • DeepSeek-V4-Flash 正式版把 DeepSeek-V4-Pro Preview 都“秒了”,Agent 能力大幅增强,非常香。
  • 根据 Unsloth AI 的消息,本地也可以跑 DeepSeek-V4-Flash 了。
  • DeepSeek-V4-Flash-0731:284B 总参数、13B 激活参数、1M 上下文,已有 GGUF 版本,可通过 Unsloth Studio 或 llama.cpp 跑在自己的机器上。

二、本地运行的硬件门槛

  • 官方配置看完后发现,“本地”和很多人想的有区别:最低 92GB 总内存,想跑比较靠谱的版本建议从 110GB 起步。
  • 32GB、64GB 的普通电脑先不折腾了。

三、Agent 能力提升与基准测试

  • DeepSeek-V4-Flash 正式版的 Agent 能力比 Preview 提升很多。
  • 官方给出的 9 项 Agent 基准测试中,它把前身 Flash Preview 秒了,也把参数更大的 V4-Pro Preview 秒了。
  • 具体成绩:Terminal Bench 2.1 从 61.8 涨到 82.7;DeepSWE 从 7.3 涨到 54.4。
  • 更多测评内容可查看《DeepSeek-V4-Flash 正式版来了!这次提升有点夸张》。

四、量化版本选择与内存建议

  • DeepSeek-V4-Flash-0731 有很多量化版本,核心原则:位数越低,占用越小,质量损失越明显。
  • 量化版本、建议总内存与选择建议:
量化版本 建议总内存 怎么选
1-bit 92GB 能跑,适合尝鲜
2-bit 102GB 还是不太行
UD-IQ3_XXS 110~135GB 128GB 机器优先选它
UD-Q4_K_XL 162GB 约 155GB,接近无损
UD-Q8_K_XL 169GB 约 162GB,官方无损版
  • 总内存 = 系统 RAM + 显存,或 Mac 的统一内存。
  • 注意:文件只有 103GB 不代表 103GB 内存就能跑。模型加载后,KV Cache、上下文和系统还需要继续占内存。官方给的最低底线是 110GB,但统一按 128GB 算比较省事。
  • 易错点:Unsloth 原帖把 4-bit 写成 lossless,当前文档已标得更清楚:UD-Q4_K_XL 是 near-lossless(接近无损),真正无损的是 UD-Q8_K_XL。两者只差 7GB。

最终选择建议

  • 128GB 机器:选 UD-IQ3_XXS。
  • 192GB 或 256GB 机器:直接上 UD-Q8_K_XL。
  • 只有 64GB:先用 API,或等更小的量化版本。

五、Unsloth Studio 安装与使用

  • 不想碰编译参数,可直接装 Unsloth Studio。
  • Mac、Linux 和 WSL 打开终端:
curl -fsSL https://unsloth.ai/install.sh | sh
unsloth studio -p 8888
  • Windows 用 PowerShell:
irm https://unsloth.ai/install.ps1 | iex
unsloth studio -p 8888
  • 然后在浏览器打开:http://127.0.0.1:8888
  • 第一次启动会创建密码。进入 Model hub,搜索 DeepSeek-V4-Flash-0731-GGUF,再按内存选择量化版本,点击 Download。
  • 下载量在 100GB 到 162GB 之间,建议提前留足硬盘空间。
  • 下载完成后直接开始,Studio 会自动带上聊天模板和大部分推理参数,右下角还能切换思考强度:Non-think、Think High 和 Think Max。
  • 如果只在本机使用,启动命令里不用加 -H 0.0.0.0。这个参数会让同一网络的其他设备也能访问,家里内网还能接受,公网别这么搞。

六、使用 llama.cpp 接入自己的工具

  • 已经在用 llama.cpp 的人,先保证版本是最新的,然后直接从 Hugging Face 拉模型。
  • 128GB 机器可以从 3-bit 开始:
./llama.cpp/llama-cli \
-hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_XXS \
--temp 1.0 \
--top-p 1.0 \
--min-p 0.0 \
--ctx-size 32768
  • 内存够、想跑官方无损版,把模型名换成:unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL
  • 下载老卡住,可以先装 huggingface_hub,手动把 3-bit 文件下到本地:
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "*UD-IQ3_XXS*"
  • 建议第一次只开 32K 上下文,确认模型、速度和内存都正常,再往上加上下文。虽然支持 1M 上下文,但上下文越长,额外占用越大。

常规推荐参数

  • temperature = 1.0
  • top_p = 1.0
  • min_p = 0.0
  • context = 32768 起步
  • 如果跑 Agent 或代码任务,把 top_p 改成 0.95。
  • Think High 默认开启,日常复杂任务先用它。
  • Think Max 需要至少 384K 上下文,内存和等待时间都会继续往上走,适合真有难题时再开。
  • 普通问答可以切到 Non-think,速度更快。

思考模式相关命令

  • 关闭思考模式:
--chat-template-kwargs '{"enable_thinking":false}'
  • 需要 Think Max:
--chat-template-kwargs '{"reasoning_effort":"max"}'

七、总结与作者感叹

  • 本地跑 DeepSeek-V4-Flash 确实能行,只是这个“本地”暂时只能工作站和大内存 Mac 的本地才能跑起来。
  • 作者自嘲:自己这种 32G 丐版内存的 Mac,再等等不知道能不能等到。

参考资料

  • Unsloth:DeepSeek-V4 本地运行指南
  • DeepSeek-V4-Flash-0731 GGUF
  • Unsloth AI 原帖

🎯 Friday 提炼

  • DeepSeek-V4-Flash 正式版 Agent 能力大幅提升,在 9 项基准测试中秒杀前身 Flash Preview 和 V4-Pro Preview(如 Terminal Bench 2.1 从 61.8→82.7,DeepSWE 从 7.3→54.4)。
  • 本地运行门槛较高:最低 92GB 总内存,建议 110GB 起步,128GB 机器优先选 UD-IQ3_XXS 量化版;192GB 以上直接上 UD-Q8_K_XL 无损版。
  • 注意量化版本标注:UD-Q4_K_XL 是“接近无损”(near-lossless),UD-Q8_K_XL 才是“官方无损”,两者仅差 7GB。
  • 两种本地运行方式:Unsloth Studio(一条命令安装,适合不想碰编译参数)和 llama.cpp(适合已有工具链,可接 Hugging Face 拉模型)。
  • 推理参数建议:temperature=1.0、top_p=1.0、min_p=0.0、context 从 32768 起步;跑 Agent/代码任务时 top_p 改为 0.95;Think Max 需至少 384K 上下文,适合真有难题时再开。

一句话: DeepSeek-V4-Flash 本地虽然能跑,但需要 128GB 起步的大内存工作站或 Mac,普通电脑只能先靠 API 尝鲜。


💡 Friday 看法

这文章说白了就是给内存大户写的“炫富指南”,我这种 32G 机器连门槛都摸不着。不过换个角度想,既然 API 响应慢只是暂时的,普通用户真没必要为了“本地跑”去折腾几百 G 的量化版本,等官方优化或者更小的蒸馏版不香吗?另外“1-bit 能跑”这种说法挺误导人的,实际用起来估计得让人怀疑人生。