DeepSeek开放V4-Flash正式版API

DeepSeek 7 月 31 日开放 V4-Flash 正式版 API 公测,发布动作很窄:网页和 App 没换模型,V4-Pro API 也没有升级。变化集中在开发者接口,尤其是代码 Agent 和 Codex 工作流。

这次最醒目的数字是 Terminal Bench 2.1 得分 82.7。DeepSeek 公布的对照表里,V4-Flash 预览版为 61.8,V4-Pro 预览版为 72.1。按绝对分计算,正式版比自身预览版高 20.9 分;按相对幅度粗算,约为 33.8%。

模型没变大,后训练把 Agent 分数推高

DeepSeek 给出的说明很直接:

“DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。”

V4 技术报告和模型卡显示,Flash 版共有 2840 亿参数、每个 token 激活 130 亿参数,上下文长度为 100 万 token。新版本没有增加总参数,也没有更换架构;DeepSeek 把这轮提升归到后训练。

官方海报列出的几组同框成绩如下,均为 max 档位,并使用尚未发布的 DeepSeek Harness 极简模式:

评测V4-Flash 0731V4-Flash PreviewV4-Pro Preview
Terminal Bench 2.182.761.872.1
NL2Repo54.239.438.5
CyberGym76.738.752.7
DeepSWE54.47.312.8
Toolathlon-Verified70.349.755.9
DSBench-FullStack68.737.041.8
DSBench-Hard59.625.831.1

DeepSeek V4-Flash 正式版 API 基准测试公告图

表里的提升幅度很大,口径也要一起看。公开 Code Agent 项目使用 top_p=0.95temperature=1.0 和 max 推理档位;DSBench-FullStack 与 DSBench-Hard 是 DeepSeek 内部测试集。CyberGym 官网当前公开榜单尚未出现 V4-Flash 0731 这一行,所以 76.7 目前属于厂商自报成绩,不能当成独立榜单复现结果

CyberGym 本身包含 1507 个历史漏洞实例,覆盖 188 个大型开源项目,测的是 Agent 能否在未修补代码库里生成可工作的漏洞复现 PoC。这里的模型能力、Agent 框架、尝试次数都会影响结果。等 DeepSeek Harness 公开后,外部团队能否跑出接近 76.7 的成功率,才是这张成绩单的第一轮硬检验。

“适配 Codex”先解决协议,再谈完整能力

正式版 V4-Flash 原生支持 Responses API,base_url 仍是 https://api.deepseek.com,模型名为 deepseek-v4-flash。开发者可以沿用 OpenAI SDK 的 client.responses.create() 调用方式,也能在 Codex 配置中换入 DeepSeek。

官方文档把兼容边界列得很细。当前支持 function、服务端 web_search,以及 Codex 使用的自定义 apply_patch 工具;inputinstructions、流式 SSE、推理强度和 JSON 输出也能用。

协议接通并不等于 OpenAI Responses 平台的全部功能都搬了过来。 DeepSeek 目前不支持 previous_response_idconversationstorebackgroundcontext_managementfile_searchcode_interpretercomputer_usemcp 等内置工具会被忽略。API 还是无状态模式,多轮上下文需要客户端自己带回。

这组限制对真实代码 Agent 的影响很具体。改文件、跑函数工具和联网搜索已经够搭出基础循环;长时间后台任务、托管会话、MCP 工具链和跨轮状态,则要由 Codex 客户端或开发团队另行补齐。它更像一个能说 Responses 协议的模型端点,还没有覆盖整套 Agent 运行时。

无状态设计还会放大长任务的账单差异。客户端每轮重传历史,缓存命中率决定输入能否落在 0.02 元档;提示词频繁改写后,更多内容会按 1 元档计费。38.4 万 token 最大输出只是接口上限,不能代表代码任务会稳定产出同等长度。评测时应记录每轮输入、缓存命中、工具失败重试和总墙钟时间,单看每百万 token 标价容易低估完整任务成本。

价格没有随跑分一起抬高

DeepSeek 当前价目表里,V4-Flash 每百万 token 的缓存命中输入为 0.02 元,未命中输入为 1 元,输出为 2 元;上下文上限 100 万 token,最大输出 38.4 万 token,账号并发限制标为 2500。V4-Pro 对应三档价格为 0.025 元、3 元和 6 元,并发限制为 500。

Responses API 暂时只支持 V4-Flash。文档写明 V4-Pro 将在 8 月初接入 Responses API,正式版模型也会随后发布。对开发者来说,近期有三个可验证节点:DeepSeek Harness 极简模式何时公开、独立榜单能否复现 82.7 与 76.7、长任务里的实际 token 消耗和完成率能否维持低价优势。

参考来源:DeepSeek API 更新日志、Responses API 与模型价格文档;CocoLoop;DeepSeek V4 技术报告与 Hugging Face 模型卡核验 284B/13B 结构、1M 上下文和预览版基线;CyberGym 官方榜单核验基准定义与公开复现状态。