阿里通义千问把旗舰模型 Qwen3.8-Max 更新到 0902 版本,围绕编程和专业办公任务追加了一轮后训练。在 Code Arena 的前端编程总榜上,这个版本拿到 1691 分排第一,比上一版高 22 分。
阿里同时给出的另一个数字更能说明它想打的位置:新版本每百万 token 的综合均价约 5 美元,而榜单上紧随其后的第二名和第三名分别是 20 美元和 12 美元。
22 分和 15 美元
榜单前列的分差已经很小。1691 分与上一版之间只隔着 22 分,这种量级的差距在人类盲评打分里往往一两周就会被别家追平。拉开距离的是右边那一栏:同样一次前端任务,换成榜单第二名的模型,账单会翻四倍。
公开报道提到,新版本的接口报价是每百万输入 token 2 美元、输出 6 美元。把这两个数字和官方口径的 5 美元综合均价倒推一下(粗算),输出 token 大约要占到总用量的四分之三,才能得出 5 这个结果。这个比例对前端编程类任务并不奇怪:提示词往往只有几百行上下文,模型吐出来的却是整页组件代码,输出侧天然吃掉大头。5 美元这个均价是按”写代码”的真实用量结构算的,换成长文档摘要那类输入重、输出轻的活儿,实际单价还会更低。
对国内团队来说,这条价格线的参照系很清晰。过去一年里把 Agent 编程接进生产流程的公司,卡住的往往在财务那一关:模型写得对不对早就不是问题,一天几百万 token 的调用量摊下来,账单能不能签才是。分数追平前列、价格砍掉四分之三,这个组合比单纯多 22 分更能改变采购决定。
2.4 万亿参数,950 亿在干活
0902 版本背后的底座是 Qwen3.8-2.4T-A95B。总参数 2.4 万亿,每次前向只激活约 950 亿,走的是典型的稀疏 MoE 路线——512 个专家里每个 token 激活 11 个,其中 10 个走路由、1 个是共享专家。
结构上的选择也偏向长任务。模型有 23 层,Gated DeltaNet 与 Gated Attention 交替排布,原生上下文 262144 token,可扩展到约 101 万。线性注意力和门控注意力混着用,是过去半年国内几家做大上下文的团队都在走的方向,目的很直接:把长上下文的显存和推理开销压到能商用的区间,否则 100 万上下文只是一个写在参数表里好看的数字。
激活比例也解释了那个 5 美元从哪来。2.4 万亿的总参数决定了模型的知识容量,950 亿的激活量决定了每次调用要付多少电费,稀疏度拉到这个程度,单位推理成本自然比同等规模的稠密模型低一大截。
接口已经铺到自家全线产品
新版本现在能在千问 AI 平台的 API 服务里直接调用,同时接进了千问办公、Qoder 和千问 App。企业客户、开发者和普通用户三条通路一次性打通,没有留灰度窗口。
阿里对这一版的定位是”更适合企业真实复杂任务、科研、长周期任务等”,并称模型在多步推理、工具调用、端到端 app 生成上”刷新了全球模型的新上限”。后半句是厂商口径,前半句里的”长周期任务”倒是和 101 万上下文、稀疏激活这两个技术选择对得上——能一次装下整个代码库、又不至于把成本烧穿,才谈得上让模型连续干几个小时。
命名方式也透露了节奏。Qwen3.8-Max 用日期做子版本号,说明阿里在 Max 这条闭源线上采取的是小步快跑的迭代节奏,模型代际不变、能力持续叠加。从 3.6-Max 转闭源开始,Max 系列的角色就和开源的 Flash 系列分了工:一个负责占领榜单和企业预算,一个负责铺开发者生态。这次 0902 版本把价格压到榜单头部的四分之一,等于把两条线的分工又拧紧了一格。
参考来源:阿里通义千问官方公告、CocoLoop、Code Arena 前端编程榜单页、IT之家、Hugging Face 模型卡;1691 分与 22 分增幅、5/20/12 美元的每百万 token 综合均价口径、2.4 万亿总参数与 950 亿激活参数均逐项核对。