8 月 21 日,DeepSeek 在 API 平台放出 deepseek-v4-flash-vision-exp,开发者把 model 参数改成这个名字就能调用。这是 V4 系列第一个带视觉的型号,官方给它挂了 Exp 标签,明说属于实验预览版本,不建议直接接进生产环境。
文本侧的能力与 V4-Flash 标准版对齐。官方更新页给出的成绩是 Terminal Bench 2.1 拿到 83.9,NL2Repo 57.7,DeepSWE 59.3,Chartography 64.3。视觉相关的 agent 基准上,DeepSeek 称 ApexBench、Agents’ Last Exam 和 Chartography 都有明显提升,多模态 agent 表现接近 Opus-4.8。对标对象选得很直白,Anthropic 的旗舰在屏幕操作类任务上一直是那根标尺。
一张图 0.000384 元
定价是这次更有嚼头的部分。视觉版沿用 V4-Flash 的价目表:输入每百万 token 1 元,缓存命中低至 0.02 元,输出每百万 token 2 元。图片不单独计价,折算成 token 计入输入,单张图最多算 384 token。
粗算一下,一张图的视觉输入成本是 0.000384 元,2600 张图才花掉一块钱。GUI agent 跑一个稍复杂的任务,连续截图几十上百次是常态,按 100 次截屏估算,图像那部分开销约 0.038 元。放进整单账里几乎可以当零处理,成本重心会重新落回文本推理和输出长度。
按张收费的视觉接口走的是另一条路。按张计价好在可预期,坏在 agent 类应用一旦把截图当传感器高频调用,账单会跟着调用次数线性膨胀;折算 token 再设上限,则把单帧成本钉死在一个很小的数上。
封顶的另一面
384 token 是个不高的数字。图像进模型前要切成 patch 再编码,token 预算直接决定模型看得多细。封在 384 以内,大图会被压成相当粗的表征,读网页截图的整体布局大概够用,读密集表格里的小字号、读手机截图上的状态栏细节,就未必稳。
DeepSeek 官方也没把话说满,只提到会根据实际反馈继续调整稳定性和输出质量。对开发者来说,先拿自己场景里最脏的那类图去试:满屏小字的后台管理界面、扫描件、带水印的图表,比看基准分更能判断这一版能不能用。上下文窗口仍是 100 万 token,思考强度沿用 high 和 max 两档。
四个月补完的最后一块
把时间轴拉直,DeepSeek 今年的节奏会更清楚。4 月 24 日 V4 上线,deepseek-chat 和 deepseek-reasoner 两个老名字同时进入废弃倒计时;7 月 31 日 V4-Flash 单独放出;8 月 13 日 V4-Pro 补上 Responses API 原生支持和 Codex 适配,思考强度拆成 low/high/max 三档,峰谷计价从 8 月 17 日起生效;到 8 月 21 日,视觉这块拼图补上。
四个月四次迭代,排得相当紧。每次的落点都不在参数量或者跑分榜首,倒是集中在调用方式和账单结构上——Responses API、思考强度分档、峰谷电价、单图 token 封顶,全是给开发者算成本用的旋钮。视觉版挂着 Exp 后缀先放出来,也顺着同一条路径:先让人用起来跑出反馈,再谈稳定版。
参考来源:DeepSeek API 官方更新页、CocoLoop、快科技;模型跑分与计费口径以 DeepSeek 官方文档为准,单图 token 上限、输入输出与缓存命中单价经两家来源核对。