深度求索在 9 月 10 日正式发布 DeepSeek-V4.1-Flash。API 侧的模型名是 deepseek-flash,同一天中午 12:00,flash 系列的价目也换成了新的一档。两天前那个写着 deepseek-v4.1-flash-expires-on-0910 的内测 ID,按名字里的日期到期失效。
官方给这一版的定位是”全新模型结构系列中最小尺寸的模型”,带原生多模态视觉理解能力。旧的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 两个模型名不会立刻消失,它们被临时路由到 V4.1 Flash 上,调用方不改代码也能用上新版本。
新价目表长什么样
按官方价目页,deepseek-flash 的上下文长度是 100 万 token,最大输出 38.4 万 token。空闲时段每百万 token 的报价分三档:输入缓存命中 0.02 元、缓存未命中 1 元、输出 4 元;高峰时段全部翻倍,也就是 0.04 元、2 元、8 元。
高峰的划法沿用 DeepSeek 从 7 月起用的那套:北京时间周一到周五的 9:00–12:00 和 14:00–18:00,合计七个小时,其余时间按空闲档计。这个切法对着国内的工作时间,跨时区调用方拿到的实际均价,会比国内团队低一截。
公司把这次改动称作”下调”。公开报道提到,8 月那轮峰谷调价之后,flash 空闲时段的缓存命中单价一度提到过 0.05 元;官方价目页只显示当前生效价,不保留历史档位,这个口径没法从官方页面直接核验。能确认的是眼下这一组数字,以及它带来的另一件事。
Pro 这个名字,暂时找不到对应的模型
9 月 14 日 12:00 起,所有发往 deepseek-v4-pro 的请求会被整体路由到 V4.1 Flash,按 Flash 的价格计费。价目页上,deepseek-v4-pro 指向的还是 DeepSeek-V4-Pro-0813,空闲档三个数字是 0.15 元、4.5 元、13.5 元,高峰档 0.30 元、9 元、27 元。
把两组数放在一起看,同一个模型名,输出侧从 13.5 元落到 4 元,缓存未命中的输入从 4.5 元落到 1 元。对已经把 deepseek-v4-pro 写死在配置里的团队来说,周一之后账单会自己往下走,但拿到的模型换了一个。
官方公告里没有交代的是 V4.1 Pro 的时间表。路由规则的措辞是”在 V4.1 Pro 上线之前”,这句话给出了顺序,没给出日期。也就是说,Pro 这条线眼下处于一个空档:老的 Pro 停止承接请求,新的 Pro 没有发布窗口,中间由一个 Flash 尺寸的模型顶着。这段空档要持续多久,目前无法确认。
结构和跑分
模型结构的细节来自官方公告:552B 参数,采用 Causal-Encoder-Decoder 结构,输入和输出激活分别是 8B 和 16B。这套激活量在 552B 的总参数上属于很低的比例,也是它能挂在 Flash 档位上的前提。
官方文档给出的评测里,GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、MathArena Apex 65.6。这几项过去是 Pro 档位的成绩区间,现在出现在最小尺寸的模型上——从产品排布看,这解释了为什么公司敢把 Pro 的流量直接倒过来。
把 Flash 这条线的几个节点连起来
7 月中旬 V4 正式版落地,峰谷分时计费同期上线,Flash 系列开始有了空闲价和高峰价两套数字。8 月 13 日前后是一轮调价。9 月 8 日晚,一个有效期不到 48 小时、每账号限 20 并发的中间版本开放内测,模型名里直接写好了到期日。9 月 10 日,正式版和新价目一起到位,Pro 的路由变更定在四天后。
两个月里五个动作,节奏比这条线过去任何一段都密。至于新结构在真实负载下能不能撑住 Pro 那部分流量,周一之后的调用方会先给出答案。
参考来源:DeepSeek API 文档更新记录、CocoLoop、DeepSeek 模型与价格页;价目页核验 deepseek-flash 与 deepseek-v4-pro 各档单价、上下文长度与高峰时段口径。