DeepSeek V4 Flash Vision Exp 发布:DeepSeek 的 Agent 终于能直接看图了

过去几周,DeepSeek V4 Flash 已经可以在 Codex 和 DeepSeek Harness 里读代码、操作终端和调用工具,却有一个很现实的缺口:它看不见截图。

遇到报错界面、网页状态、设计稿和图表时,开发者只能先接另一个视觉模型,把图片转写成文字,再交给 DeepSeek 推理。这条“视觉模型负责看、DeepSeek 负责想”的桥接方案能用,但多了一次模型调用,也可能在转写过程中丢掉细节。

8 月 21 日,DeepSeek 在 API 平台上线 DeepSeek-V4-Flash-Vision-Exp。我的判断是:这次发布不是用视觉能力重新定义 V4 模型家族,而是给 Flash 补上了 Agent 工作流缺少的感知层。它最重要的价值不是“能描述一张猫图”,而是让同一个模型可以从截图、图表和工具返回的图像继续完成推理与操作。

不过,名字里的 Exp 很重要。它目前是实验性 API 模型,不等于已经开放权重、技术报告和稳定版本。

它是实验端点,不是已经开源的新基础模型

按照 DeepSeek API 更新日志,调用时使用的模型 ID 是:

1
deepseek-v4-flash-vision-exp

DeepSeek 对它的官方定位很克制:这是一个新的多模态视觉理解模型,纯文本能力,包括 Agent、推理和世界知识,与正式版 DeepSeek V4 Flash 相当;在需要视觉理解的 Agent 基准中,它相对文本版 Flash 有明显提升,整体接近 Claude Opus 4.8。

这里需要把已经确认和还没有公开的信息分开:

已经确认 截至 8 月 21 日尚未公开
已在 DeepSeek API 平台提供 独立技术报告
支持文字与图像共同输入 模型参数、视觉编码器和训练方法细节
支持 Chat Completions、Responses 和 Anthropic 兼容协议 官方 Hugging Face 权重与模型卡
文本能力被官方描述为与 V4 Flash 相当 正式版发布日期与兼容承诺

因此,不能只凭名字断言它就是 DeepSeek-V4-Flash-0731 加了某个特定视觉塔,也不能把它称为新的开源多模态模型。更准确的说法是:DeepSeek 发布了一个与 Flash 产品层级对齐的视觉实验端点。

它与我之前介绍的 DeepSeek V4 Flash 正式版 最大区别,不是文本推理更强,而是请求里终于可以携带原生图像。

三种图片输入,把视觉接进现有 API

DeepSeek Vision 指南支持 JPEG、PNG、GIF 和 WebP,并提供三种图片输入方式:

输入方式 适合场景 主要限制
Base64 内联 本地小图片、单次调用 请求体上限 48 MiB,单图不超过 32 MiB
公网 URL 已有可公开访问的图片 URL 不超过 8192 字符,单图不超过 32 MiB,下载需在 60 秒内完成
Files API file_id 大图片或同一图片反复使用 单图可到 64 MiB,需要先上传文件

最简单的 Python 调用仍然使用 OpenAI SDK:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
import base64
from openai import OpenAI

client = OpenAI(
api_key="<DeepSeek API Key>",
base_url="https://api.deepseek.com",
)

with open("error.png", "rb") as image_file:
encoded = base64.b64encode(image_file.read()).decode("utf-8")

response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "读取报错信息并给出排查步骤。"},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{encoded}"
},
},
],
}
],
)

print(response.choices[0].message.content)

如果应用已经使用 Responses API,图片改放在 input_image 内容块中;如果使用 Anthropic 兼容的 /messages 接口,则使用 imagesource 对象。DeepSeek 没有要求开发者采用一套新的私有多模态协议,而是把视觉输入放进现有三套接口。

这对 Agent 集成很重要。DeepSeek Harness、Codex 适配层或自研工具可以继续保留现有会话和工具调用,只需要确认客户端的模型目录允许图像输入,并按照对应协议发送图片。

一次可以传 600 张图,但每张图最多 384 Token

视觉模型最容易被忽略的成本,不是图片文件有多大,而是图片进入模型后会变成多少 Token。

DeepSeek 会在推理前自动缩放图片:像素总量低于约 384×384 的图片会等比例放大;更大的图片会被缩小到总像素约等于 800×800。因此,每张图片最多消耗 384 个输入 Token。一张 2000×2000 图片和一张 5000×5000 图片,缩放后可能消耗相同的图像 Token。

这带来两个相反的结果。

一方面,成本有清楚上界。传入一张高分辨率截图,不会因为原始像素增加而无限放大账单。另一方面,原图越大不代表模型能看到越多细节。过密的表格、小字号日志、长网页截图和精密工程图在缩放后仍可能丢失信息。

API 允许每次请求最多 600 张图片;不含 file_id 图片时,全部图片总大小不能超过 64 MiB,包含 file_id 时总上限可到 200 MiB。如果一次请求包含 15 张或更多图片,单边最大尺寸会从 8192 像素降到 4096 像素。

600 是接口容量,不是使用建议。按每张 384 Token 做上限估算,600 张图片本身就可能占用 230,400 个输入 Token,还没有计算文字、工具定义和历史上下文。批量视觉任务仍然需要分页、筛选和阶段性汇总。

对于不需要细节的图片,还可以设置 detail: "low",在推理前缩放到 512×512highoriginal 保留原始处理方式,auto 目前等同于 original。因此,图像路由也可以分层:缩略图分类先用 low,OCR、图表和 UI 细节再使用原始模式。

文本 Agent 能力没有退回去,视觉才是新增变量

DeepSeek 同时公布了九项结果,其中既有终端和代码 Agent 测试,也有图表与视觉推理测试。

先看可以与此前官方版本对照的 Agent 数据:

基准 Vision Exp V4 Flash 0731 V4 Pro 0813
Terminal Bench 2.1 83.9 82.7 87.9
NL2Repo 57.7 54.2 61.5
DeepSWE 59.3 54.4 62.7
DSBench-Hard 63.6 59.6 67.2
AutomationBench Public 25.7 25.1 31.8
Agents’ Last Exam 27.3 25.2 25.7

这些数字来自 DeepSeek 自己在不同发布日期公布的测试。代码 Agent 公共任务使用 DeepSeek Harness minimal mode、max effort、top_p=0.95temperature=1.0DSBench-Hard 则是 DeepSeek 内部测试集。它们适合说明官方产品定位,不能替代独立评测。

至少从这套口径看,加入视觉输入没有牺牲 Flash 原有的终端、仓库修改和自动化能力。Vision Exp 大致落在 Flash 与 Pro 之间,个别项目略高于此前 Flash,仍不意味着它在纯文本任务上全面取代 Pro。

视觉相关结果则是:

基准 Vision Exp 官方成绩 主要测试内容
APEX-Agents 36.5 Pass@1 在办公软件中完成投资银行、咨询和法律等长流程任务
Agents’ Last Exam 27.3 跨行业、长时程、可验证的真实工作任务,其中包含多模态材料
Chartography 64.3(p0.95)/ 63.3(p1.0) 读取医疗、金融、制造和工程等专业图表
ZeroBench 35.0 Pass@5 高难度开放式视觉识别与多步推理

Chartography 论文在发布时评测了 30 个前沿模型配置,最高成绩只有 45.0%;ZeroBench 官方页面则把厂商自行报告与项目方独立运行的结果分开展示。DeepSeek 当前只给出了发布数字,没有同时公开完整轨迹、逐题结果或第三方复现。

因此,Chartography 64.3ZeroBench 35.0 很值得关注,但暂时应该写成 DeepSeek 官方报告成绩,而不是已经由独立榜单确认的新纪录。DeepSeek 所说的“多模态 Agent 能力接近 Opus 4.8”,也属于厂商对自身测试的总结。

视觉没有单独加价,但仍按输入 Token 计费

DeepSeek 当前价格表看,Vision Exp 与 V4 Flash 使用同一档价格和并发额度:

每 100 万 Token 非高峰 高峰
输入,缓存命中 $0.007 $0.014
输入,缓存未命中 $0.22 $0.44
输出 $0.66 $1.32
并发上限 2500 2500

高峰时段是 UTC 01:00–04:0006:00–10:00,对应北京时间 09:00–12:0014:00–18:00;其他时间执行非高峰价格。

图片转换出的 Token 会与文字输入一起计费,没有另一张按图片张数计算的价目表。按非高峰缓存未命中价格估算,单张图片即使达到 384 Token 上限,输入成本也不到 0.0001 美元;真实任务的主要费用通常仍来自长文本上下文、思考输出、工具循环和失败重试。

模型还支持 100 万 Token 上下文、最大 384K 输出、JSON Output、Tool Calls、Responses API、Anthropic API 和 Chat Prefix Completion。FIM Completion 目前不支持。

低单价让它适合大量截图和工具循环,但“图片便宜”不能代替质量评测。OCR 错一个字符、图表读错一条轴、把按钮状态看反,都可能让后面的低成本推理走向错误方向。

它最适合补上 Agent 的感知层

Vision Exp 的直接使用场景不是泛泛的“图像问答”,而是原来需要视觉桥接的 Agent 工作流:

  • 前端开发:读取设计稿、浏览器截图和响应式布局,再结合代码修改页面;
  • 故障排查:识别终端截图、监控图表和管理后台错误状态;
  • 浏览器自动化:结合页面截图判断弹窗、按钮状态和流程是否完成;
  • 文档处理:把 PDF 页面渲染成图片,读取扫描件、表格和图形;
  • 数据分析:解释 K 线图、Sankey 图、Bode 图和其他专业可视化;
  • 多模态验收:让 Agent 在修改 UI 后查看真实截图,而不是只凭 DOM 或测试日志宣布完成。

这与 DeepSeek Harness 的插件化方向正好拼在一起。Harness 提供浏览器、文件、终端、会话和权限;视觉模型把工具产生的图像重新带回推理循环。Agent 不再需要一个独立模型先写“图片说明书”,再交给文本模型猜测原始画面。

但采用前仍应做三类测试:

  1. 感知正确性:小字号 OCR、坐标轴、颜色图例、按钮禁用状态能否稳定识别;
  2. 端到端结果:模型看完图片后,是否真的完成修改、验证或决策,而不是只生成一段描述;
  3. 失败边界:图片过密、模糊、被缩放或格式异常时,模型会不会明确承认不确定,而不是编造细节。

Exp 决定了现在应该怎样使用

DeepSeek V4 Flash Vision Exp 已经不只是发布预告:API 文档、价格表和三套兼容协议都已经上线,可以真实调用。

但它也还不是一个信息完整的正式开源模型。截至 8 月 21 日,DeepSeek 没有为这个精确名称公开 Hugging Face 模型卡、GitHub 权重仓库或独立技术报告。模型架构、视觉训练数据、正式版本路径和第三方复现仍然缺失。

因此,现在最合适的采用方式是:

  • 用实验模型 ID 固定测试,不把它伪装成稳定的 deepseek-v4-flash
  • 先在截图理解、图表分析和 UI 验收等低风险任务中建立回归集;
  • 对 OCR、金额、坐标和外部写入保留原始图片回读与人工审批;
  • 记录图像数量、detail、Token、工具轮数和失败类型;
  • 等待正式版、模型卡或独立评测,再决定是否替换生产视觉链路。

DeepSeek V4 Flash Vision Exp 没有改变 V4 Flash 是默认执行层、V4 Pro 是更强推理层的基本位置。它填上的,是两者此前都缺少的一块:让 Agent 看见正在操作的世界。

视觉不是多了一个聊天功能,而是 Agent 从“只能读接口返回”走向“能够检查真实结果”的前提。

资料与口径