DeepSeek 7 月 31 日开放 V4-Flash 正式版 API 公测,发布动作很窄:网页和 App 没换模型,V4-Pro API 也没有升级。变化集中在开发者接口,尤其是代码 Agent 和 Codex 工作流。
这次最醒目的数字是 Terminal Bench 2.1 得分 82.7。DeepSeek 公布的对照表里,V4-Flash 预览版为 61.8,V4-Pro 预览版为 72.1。按绝对分计算,正式版比自身预览版高 20.9 分;按相对幅度粗算,约为 33.8%。
模型没变大,后训练把 Agent 分数推高
DeepSeek 给出的说明很直接:
“DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。”
V4 技术报告和模型卡显示,Flash 版共有 2840 亿参数、每个 token 激活 130 亿参数,上下文长度为 100 万 token。新版本没有增加总参数,也没有更换架构;DeepSeek 把这轮提升归到后训练。
官方海报列出的几组同框成绩如下,均为 max 档位,并使用尚未发布的 DeepSeek Harness 极简模式:
| 评测 | V4-Flash 0731 | V4-Flash Preview | V4-Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

表里的提升幅度很大,口径也要一起看。公开 Code Agent 项目使用 top_p=0.95、temperature=1.0 和 max 推理档位;DSBench-FullStack 与 DSBench-Hard 是 DeepSeek 内部测试集。CyberGym 官网当前公开榜单尚未出现 V4-Flash 0731 这一行,所以 76.7 目前属于厂商自报成绩,不能当成独立榜单复现结果。
CyberGym 本身包含 1507 个历史漏洞实例,覆盖 188 个大型开源项目,测的是 Agent 能否在未修补代码库里生成可工作的漏洞复现 PoC。这里的模型能力、Agent 框架、尝试次数都会影响结果。等 DeepSeek Harness 公开后,外部团队能否跑出接近 76.7 的成功率,才是这张成绩单的第一轮硬检验。
“适配 Codex”先解决协议,再谈完整能力
正式版 V4-Flash 原生支持 Responses API,base_url 仍是 https://api.deepseek.com,模型名为 deepseek-v4-flash。开发者可以沿用 OpenAI SDK 的 client.responses.create() 调用方式,也能在 Codex 配置中换入 DeepSeek。
官方文档把兼容边界列得很细。当前支持 function、服务端 web_search,以及 Codex 使用的自定义 apply_patch 工具;input、instructions、流式 SSE、推理强度和 JSON 输出也能用。
协议接通并不等于 OpenAI Responses 平台的全部功能都搬了过来。 DeepSeek 目前不支持 previous_response_id、conversation、store、background 和 context_management;file_search、code_interpreter、computer_use、mcp 等内置工具会被忽略。API 还是无状态模式,多轮上下文需要客户端自己带回。
这组限制对真实代码 Agent 的影响很具体。改文件、跑函数工具和联网搜索已经够搭出基础循环;长时间后台任务、托管会话、MCP 工具链和跨轮状态,则要由 Codex 客户端或开发团队另行补齐。它更像一个能说 Responses 协议的模型端点,还没有覆盖整套 Agent 运行时。
无状态设计还会放大长任务的账单差异。客户端每轮重传历史,缓存命中率决定输入能否落在 0.02 元档;提示词频繁改写后,更多内容会按 1 元档计费。38.4 万 token 最大输出只是接口上限,不能代表代码任务会稳定产出同等长度。评测时应记录每轮输入、缓存命中、工具失败重试和总墙钟时间,单看每百万 token 标价容易低估完整任务成本。
价格没有随跑分一起抬高
DeepSeek 当前价目表里,V4-Flash 每百万 token 的缓存命中输入为 0.02 元,未命中输入为 1 元,输出为 2 元;上下文上限 100 万 token,最大输出 38.4 万 token,账号并发限制标为 2500。V4-Pro 对应三档价格为 0.025 元、3 元和 6 元,并发限制为 500。
Responses API 暂时只支持 V4-Flash。文档写明 V4-Pro 将在 8 月初接入 Responses API,正式版模型也会随后发布。对开发者来说,近期有三个可验证节点:DeepSeek Harness 极简模式何时公开、独立榜单能否复现 82.7 与 76.7、长任务里的实际 token 消耗和完成率能否维持低价优势。
参考来源:DeepSeek API 更新日志、Responses API 与模型价格文档;CocoLoop;DeepSeek V4 技术报告与 Hugging Face 模型卡核验 284B/13B 结构、1M 上下文和预览版基线;CyberGym 官方榜单核验基准定义与公开复现状态。