跳转至

刚刚,DeepSeek首个多模态模型发布!!

公众号:Datawhale 分类:LLM 处理状态:已完成(代理即时处理)


内容摘要(忠实笔记)

最新发布:DeepSeek-V4-Flash-Vision-Exp 就在刚刚,DeepSeek 第一个多模态视觉理解模型来了。

最新官方 API 文档显示,一款名为 deepseek-v4-flash-vision-exp 的实验性模型已经上线。和此前只能处理文本的 V4 系列不同,新模型正式加入图片理解能力。现在,它不仅能读文字、写代码、调用工具,还能直接查看图片、识别截图中的文字、分析图表,并围绕视觉信息完成后续任务。

一、DeepSeek,终于补上了"眼睛"

  • 从命名来看,deepseek-v4-flash-vision-exp 基于 V4 Flash,后缀中的 vision-exp 表明它目前仍是一款实验性视觉模型。
  • 支持 JPEG、PNG、GIF 和 WebP 四种图片格式。
  • 开发者可以直接提交 Base64 编码图片、提供公开访问的图片 URL,或者通过 Files API 上传并引用图片。
  • 同时兼容 OpenAI Chat Completions、Responses API 与 Anthropic API 格式。
  • 现有 Agent 和开发工具不必重新设计整套接口——修改模型名称和图片内容块,就能接入 DeepSeek 的视觉能力。

二、一次最多看 600 张图

  • 单次请求最多可以输入 600 张图片,图片最长边最高支持 8192 像素。
  • Base64 或外部 URL:单张图片最大 32 MiB;Files API:单张最大 64 MiB;包含 file_id 图片时:单次请求图片总量最高 200 MiB。
  • 提供不同图片细节等级:low 模式缩放至 512×512(速度更快、Token 消耗更低);original 保留原图;auto 当前等同原图。
  • 每张图片按尺寸换算 Token,单张消耗最高为 384 Token,超高分辨率输入成本也不会无限增长。
  • 更适合批量截图分析、长文档检查、数据图表理解,以及需要持续观察界面的视觉 Agent。

三、多模态 Agent,开始逼近 Opus

  • 据官方发布,新模型在多项 Agent Benchmark 上成绩:相比原 V4 Flash,依赖视觉理解的 Agent 任务上提升明显,多模态 Agent 能力已接近 Claude Opus 4.8。
  • 该比较尚未出现在 DeepSeek 官方模型文档中,需等待更完整技术说明与第三方测试。
  • 真正值得关注的是 DeepSeek 正在把视觉理解与原有推理、编程、工具调用能力连接起来。过去主要依靠文本、网页源码和结构化数据理解环境;现在可直接读取软件界面、错误截图、数据图表和图文混排文档,再决定下一步调用什么工具。

四、价格与 V4 Flash 相同

  • 调用价格与 V4 Flash 保持一致,采用高峰、空闲两档计费。高峰时段为北京时间 9:00—12:00、14:00—18:00,其余为空闲时段。
  • 图片按尺寸转换为 Token,与文本 Token 一并计费。
  • 并发限制为 2500,与 V4 Flash 相同。
  • 如果后续正式版维持这一价格,DeepSeek 可能再次压低多模态 Agent 的使用门槛。

写在最后:现在已经可以调用

  • 通过 DeepSeek API 访问,原 API 地址不变:https://api.deepseek.com
  • 只需把模型名称修改为:deepseek-v4-flash-vision-exp
  • 使用 DeepSeek Harness 需升级至 0.1.1-rc.1 或更高版本。
  • 注意:模型名称中的 exp 说明仍处于实验阶段,能力表现、接口限制和模型版本后续都可能调整。目前也只有这一视觉模型能接受图片;将图片传给普通 V4 Flash 或 V4 Pro 会直接返回错误。
  • 视觉版暂不支持 FIM 补全,图片在 Chat Completions 与 Anthropic Messages 接口中只能出现在 user 消息里。

产品结构更完整: - Flash:速度和低成本 - Pro:复杂推理与高规格 Agent - Vision:图像、截图与界面理解

一句话总结:DeepSeek 发布首个多模态模型 deepseek-v4-flash-vision-exp,支持最多 600 张图/8192 像素输入、兼容三家主流 API 格式,价格与 V4 Flash 持平,多模态 Agent 能力逼近 Claude Opus 4.8,低成本补上了视觉这块拼图。


💡 Friday 看法

这篇发布对咱们手上这套工具链影响不小——哥哥你自建的 AI 信息收集工具(Exa 搜索 → MongoDB+Qdrant → Qwen3.5-397B 生成中日双语简报)和部门 ZJTZ AI 业务门户,都是重 Agent 的视觉/表格场景。最关键的是它兼容 OpenAI/Anthropic 两家 API 格式,意味着接入成本几乎为零,改个模型名就能把现在的视觉管线(DashScope qwen-vl / Doubao / mimo-v2.5)多一条低价备选。单张最高 384 Token 的计费方式,批量截图分析、图文混排文档这类任务很适合试水。不过 exp 实验版 + benchmarking 还没进官方文档,建议先拿长截图表格这类实际场景压测,别急着上生产。