DeepSeek V4 Flash 正式版:架构没变,为什么 Agent 能力大幅跃升?

DeepSeek V4 Flash 正式版最容易被误读的一句话,是“多项 Agent 跑分远超 V4 Pro 预览版”。

这看起来像一个熟悉的故事:更小的模型打败了更大的模型。但 DeepSeek 自己给出的信息恰好否定了这种简单解释——正式版 Flash 与预览版的架构、参数规模完全相同,唯一的模型变化是重新后训练

所以这次发布真正值得讨论的,不是“13B 激活参数打败 49B”,而是另一个更接近现实的问题:当 AI 开始操作终端、修改仓库和调用工具时,我们测到的究竟是模型能力,还是“模型 + 后训练 + Harness + 推理预算”的系统能力?

先把“正式版”说清楚

2026 年 7 月 31 日,DeepSeek 在 API 更新日志中宣布 DeepSeek-V4-Flash-0731 正式版 API 进入公测。调用方式没有变化,模型名仍然是 deepseek-v4-flash

这里有三个容易被标题省略的边界:

  • 本次只升级了 Flash API,DeepSeek App、Web 和 V4 Pro API 都没有更新;
  • 被超过的是 V4 Pro Preview,不是尚未发布的 V4 Pro 正式版;
  • 官方列出的九组成绩里,DSBench-FullStackDSBench-Hard 是 DeepSeek 内部测试集。

去掉两组内部数据,只看 DeepSeek 官方模型卡列出的七组公开基准,正式版 Flash 仍然全部领先 Pro 预览版:

公开基准 Flash 正式版 Flash 预览版 Pro 预览版 相对 Pro 预览版
Terminal-Bench 2.1 82.7 61.8 72.1 +10.6
NL2Repo 54.2 39.4 38.5 +15.7
CyberGym 76.7 38.7 52.7 +24.0
DeepSWE 54.4 7.3 12.8 +41.6
Toolathlon-Verified 70.3 49.7 55.9 +14.4
Agents’ Last Exam 25.2 15.8 16.5 +8.7
AutomationBench Public 25.1 10.8 12.8 +12.3

其中最夸张的是 DeepSWE:同一套 Flash 架构从 7.3 提升到 54.4,增加了 47.1 分。这样的变化很难用“模型又大了一点”解释,因为模型根本没有变大。

13B 激活参数,不等于 13B 小模型

按照 DeepSeek V4 技术报告,V4 Flash 是一个 MoE 模型,总参数 284B,每个 token 激活 13B;V4 Pro 总参数 1.6T,每个 token 激活 49B。两者都原生支持 100 万 token 上下文。

“13B 激活”描述的是一次推理实际参与计算的参数量,不是模型文件只有 13B。把 Flash 叫作“13B 小模型”会同时忽略 284B 的专家参数、路由机制和部署成本。

它的效率优势仍然是真实的。V4 使用 CSA(压缩稀疏注意力)和 HCA(高度压缩注意力)组成混合注意力架构,目标就是降低长上下文下的计算量与 KV Cache。只是这种“轻量”更准确的含义,是每个 token 使用更少的有效计算,而不是可以随手塞进一台笔记本。

更重要的是,DeepSeek 在发布日志里明确写道:DeepSeek-V4-Flash-0731 与 Flash Preview 的架构和规模相同,只做了重新后训练。由此可以得到一个相当直接的判断:正式版的 Agent 跃升主要来自后训练释放了既有架构的能力,而不是一次新的预训练规模竞赛。

这个判断也有边界。技术报告对 Flash 和 Pro 的比较并没有宣布“Flash 全面取代 Pro”:Flash 在知识评测上仍受参数规模限制;增加思考预算后,它可以在推理任务上接近 Pro,但在更复杂、更困难的 Agent 任务上仍然落后。

Agent 跑分测的不是一颗“裸模型”

如果把语言模型比作赛车的发动机,Agent Harness 就是变速箱、轮胎、车手和维修策略。终端任务最终能否完成,取决于整辆车,而不只取决于发动机排量。

DeepSeek 官方也没有隐藏这件事。其公开 Code Agent 成绩使用尚未发布的 DeepSeek Harness minimal mode,推理强度为 max,并设置 top_p=0.95temperature=1.0。换句话说,82.7 不是把模型接进任意 Agent 后都能自动得到的成绩。

Artificial Analysis 的独立评测提供了一个很好的对照。它使用 Terminus 2 Harness,在 e2b 沙箱里对每个任务重复三次并统计 pass@1;同一 DeepSeek V4 Flash 0731 Max 在 Terminal-Bench 2.1 上得到 78.7%,比 DeepSeek 自报的 82.7 低 4 分。

这不代表哪一方“测错了”。不同 Harness 会改变命令组织、错误恢复、上下文管理和工具反馈,4 分差异恰好说明 Agent 基准不是纯粹的模型考试。

截至 2026 年 8 月 3 日,Terminal-Bench 官方验证榜单列出的 17 项结果中还没有 V4 Flash。因此,82.7 应当被视为厂商在指定条件下报告的成绩;78.7 则是目前更适合交叉参考的独立结果。二者都值得看,但不能混成同一个口径。

Flash 的优势是单价,但总成本还要看它想多久

DeepSeek 当前 API 定价把 Flash 和 Pro 放在了非常清楚的两个位置:

每 100 万 token V4 Flash V4 Pro
输入(缓存未命中) $0.14 $0.435
输入(缓存命中) $0.0028 $0.003625
输出 $0.28 $0.87
并发上限 2500 500

如果只看普通输入和输出单价,Pro 大约是 Flash 的 3.1 倍;Flash 的并发上限则是 Pro 的 5 倍。这说明它的产品定位已经不只是“快速回复”,而是承担大量 Agent 循环的默认执行引擎。

但“每 token 便宜”不等于“每个任务一定便宜”。Artificial Analysis 的模型页显示,V4 Flash 0731 Max 在其 Intelligence Index 中得到 50 分,在同类 101 个模型中排第 3;与此同时,它为整套评测生成了约 2.1 亿输出 token,而同类中位数约为 1 亿,完成评测共花费 72.02 美元。

这组数据揭示了 Flash 的另一个特点:它可以用更长的思考换取更高能力。低单价为这种 test-time scaling 提供了空间,但真实账单仍由输出长度、工具轮数、失败重试和上下文缓存共同决定。

因此,评估 Agent 模型时,至少要同时记录三个指标:

  1. 任务成功率,而不是单轮回答是否“看起来正确”;
  2. 完成一个任务的总 token 与总费用,而不是 API 价目表上的单价;
  3. 端到端耗时,而不是模型开始吐字后的 tokens/s。

正式版 Flash 正在变成“默认层”

DeepSeek 为 Flash 原生支持 Responses API,并专门适配了 Codex。官方 Codex 集成文档写得很直接:目前只有 deepseek-v4-flash 支持 Codex,Pro 预计在 2026 年 8 月上旬跟进。

这比跑分更能说明产品意图。Flash 被优先放进 Coding Agent 的调用链,不是因为它在所有任务上最强,而是因为它同时具备几个适合做默认层的条件:

  • 公开权重和 MIT 许可证,允许自部署与二次集成;
  • 100 万 token 上下文,能容纳更长的代码与工具轨迹;
  • 相对低廉的输入、输出价格和更高并发;
  • 在多个 Agent 基准上已经进入旗舰模型附近的能力区间。

一个更合理的工程策略,不是让 Flash 或 Pro 独占所有请求,而是做分层路由:让 Flash 处理大多数检索、修改、测试和修复循环;遇到高难知识、长链推理或连续失败,再升级到 Pro 或其他更强模型。

这里的关键指标不是“最强模型用了多少次”,而是多少任务在最低可接受成本下稳定闭环

这次发布真正改变了什么

DeepSeek V4 Flash 正式版并没有证明“参数不重要”,也没有证明 Flash 已经全面超过 Pro。它证明的是另一件事:在架构不变的前提下,后训练可以大幅改变模型在工具环境中的行为;而进入 Agent 场景后,Harness 与推理预算又会继续放大或压缩这种能力。

过去我们习惯用参数量给模型排座次。现在更有用的问题变成了:同一个任务,在什么 Harness、多少思考 token、几次工具调用和多少美元之后,模型能够稳定完成?

V4 Flash 名字里仍然有一个 “Flash”,但它已经不再只是速度档。它正在变成默认执行层——不是因为它永远最聪明,而是因为它开始有能力把足够多的任务,以足够低的单次成本跑完。


本文数据查询于 2026 年 8 月 3 日。API 价格、排行榜和公测状态会变化;部署或选型前应重新核对 DeepSeek API 文档模型卡与独立评测页面。