DeepSeek 於 7 月 31 日開放 V4-Flash 正式版 API 公測。Web 與 App 模型未更換,V4-Pro API 也沒有升級,變動集中在開發者介面、程式碼 Agent 和 Codex 工作流程。
最醒目的數字是 Terminal Bench 2.1 得分 82.7。官方比較表列出 V4-Flash Preview 為 61.8、V4-Pro Preview 為 72.1。正式版比自身預覽版增加 20.9 分,相對幅度約 33.8%。
模型未擴大,後訓練推高分數
「DeepSeek-V4-Flash-0731 的模型結構、尺寸和 DeepSeek-V4-Flash-preview 保持一致,僅重新進行了後訓練。」
V4 技術報告和模型卡顯示,Flash 版共有 2840 億參數、每個 token 啟用 130 億參數,上下文長度為 100 萬 token。這輪提升沒有增加總參數,也沒有更換架構。
官方以 max 檔位和未公開的 DeepSeek Harness 極簡模式測得:Terminal Bench 2.1 為 82.7、NL2Repo 54.2、CyberGym 76.7、DeepSWE 54.4、Toolathlon-Verified 70.3、DSBench-FullStack 68.7、DSBench-Hard 59.6。

評測條件必須同時保留。公開 Code Agent 任務使用 top_p=0.95、temperature=1.0 和 max 推理檔位;兩項 DSBench 屬內部測試。CyberGym 公開排行榜目前還沒有 V4-Flash 0731,因此 76.7 仍是廠商自報成績,尚非獨立復現結果。
CyberGym 包含 1507 個歷史漏洞案例,涵蓋 188 個大型開源專案,測試 Agent 能否在未修補的程式碼庫中產生可運作的 PoC。Agent 框架與嘗試次數會改變結果,DeepSeek Harness 公開後才有條件做第一輪硬核驗。
Codex 適配先解決協定
V4-Flash 在 https://api.deepseek.com 原生接受 Responses API 格式,模型名為 deepseek-v4-flash。開發者可以沿用 OpenAI SDK 的 client.responses.create() 形式,也能從 Codex 設定接入。
目前支援 function、伺服器端 web search、Codex 使用的自訂 apply_patch,以及 SSE 串流、推理強度和 JSON 輸出。
協定相容不代表 Responses 平台功能全數可用。 previous_response_id、conversation、store、background 和 context management 尚未支援;file search、code interpreter、computer use、MCP 也會被忽略。API 採無狀態模式,多輪上下文要由客戶端重新送入。
價格沒有跟著跑分上漲
V4-Flash 每百萬 token 的快取命中輸入為 0.02 元、未命中輸入 1 元、輸出 2 元;支援 100 萬 token 上下文、最多 38.4 萬 token 輸出,帳號併發限制為 2500。V4-Pro 同三項價格為 0.025 元、3 元和 6 元,併發限制 500。
Responses API 現階段只支援 V4-Flash,V4-Pro 預計 8 月初接入。後續檢驗點包括 harness 公開、82.7 與 76.7 能否獨立復現,以及真實長任務的 token 消耗與完成率。
參考來源:DeepSeek API 更新日誌、Responses API 與模型價格文件;CocoLoop;DeepSeek V4 技術報告與 Hugging Face 模型卡核驗 284B/13B 結構、1M 上下文和 Preview 基準;CyberGym 官方網站核驗評測定義與公開復現狀態。