阿里首次開放千問Max級模型權重

Qwen3.8-Max 终于从“下周開放”的承诺,走到了模型仓库页面。 8 月 12 日晚,ModelScope 的 Qwen/Qwen3.8-2.4T-A95B 页面显示,模型已发布,仓库包含后训练模型的權重和配置文件,格式兼容 Hugging Face Transformers,并面向 vLLM、SGLang、TokenSpeed 等推理框架。页面元数据还给出一个不太常见的数字:仓库体积约 4.89TB。 阿里已经在 7 月把 Qwen3.8 推到台前。CocoLoop 当时报道过 Qwen3.8-Max-Preview 登陆 Qoder 和 Token Plan,重点是 2.4 万亿参数、折扣计费和“后续開放權重”的承诺。今天的新节点更硬:**阿里第一次把 Qwen-Max 級別模型做成開放權重倉庫**,开发者终于可以把发布材料里的参数、上下文和部署限制拉到本地环境里检查。 ## 4.89TB 權重先把门槛摆出来 ModelScope 模型卡写得很直接: > “This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.” 这句话把 Qwen3.8-2.4T-A95B 和普通 API 发布区分开了。它具备云端调用之外的形态:一套可被框架加载的開放權重模型。 模型概览给出几个关键口径:总参数 2.4T,每 token 激活 95B;原生上下文长度 262,144 tokens,可扩展至 1,010,000 tokens;架构包含 92 层、512 个专家,每次路由激活 10 个专家加 1 个共享专家;词表规模为 248,320。页面还标注,Qwen3.8-2.4T-A95B 是文本模型,必须启用 thinking mode,多模态输入和关闭思考模式都不支持。 这里要分清两件事。Qwen Cloud 里的官方 Qwen3.8-Max 服务提供更多产品能力,包括视觉输入、非思考模式、默认 1M 上下文和官方内置工具;ModelScope 这套權重更像底层模型本体。一个适合直接买服务,一个适合有算力和工程团队的公司做自部署、框架适配和内部评测。 ## 開放 Max 级模型,是生态动作 阿里此前的 Qwen 路线有一个反复出现的节奏:用開放模型吸引开发者,再用云 API、工具平台和企业入口变现。Qwen3.6-27B、Qwen3.6-35B-A3B 等小中型模型已经把本地部署门槛打低;Qwen3.8-2.4T-A95B 则把问题反过来问了一遍:当模型规模来到 Max 级,開放權重还能不能成立? 答案不会只看“能不能下载”。4.89TB 的仓库体积意味着绝大多数个人开发者不会直接拉满權重跑推理,企业也要面对存储、显存、并行推理、量化、吞吐和安全隔离成本。開源社区更可能先围绕 vLLM、SGLang、TokenSpeed、量化版本和托管推理服务形成二级生态。 開放權重的产业意义也在这里。阿里把最大模型權重放出来后,外部团队可以复现 benchmark、改推理引擎、做低比特量化、测企业代码库和长文档任务,也可以指出官方指标的口径问题。对开发者来说,API 折扣会结束,權重和许可证会决定模型能否进入长期技术栈。 ## 跑分好看,也要看脚注 官方模型卡列出一长串 benchmark。Qwen3.8-Max 在 Terminal Bench 2.1 上为 86.6,较 Qwen3.7-Max 的 74.5 提升明显;SWE-bench Pro 为 67.7,低于 Fable 5 的 80.0,但高于 GPT-5.6 Sol 的 64.6;PaperBench 为 93.0,高于页面列出的 Opus 4.8、Fable 5、GPT-5.6 Sol 和 Qwen3.7-Max;OSWorld-Verified 为 86.1,高于 Qwen3.7-Max 的 73.3。 这些数字能说明 Qwen3.8 的定位:聊天和单轮代码补全只是入口,官方更想把编程智能体、办公协作、研究复现和长程任务放在同一张表里评估。 但脚注也提醒读者谨慎。Terminal Bench、SWE-bench Pro、DeepSWE、NL2Repo-Bench、FrontierSWE 等项目使用的 harness、超时、上下文窗口和外部基线來源并不完全一致;有些结果来自官方自测,有些来自公开榜单或重算。把 86.6、67.7、93.0 直接混成“全面超越某模型”,并不严谨。更好的看法是:Qwen3.8 已经进入可被认真复测的区间,下一步要看第三方能否在相同任务、相同工具链和相同成本下复现。 ## 对中国团队的价值在可控性 Qwen3.8 權重開放对中国开发团队有一个现实增量:可控性。 企业做代码智能体、财务分析、合同处理、客服质检或研发资料检索时,常常卡在三件事上:数据能否离开内网,成本是否能在高频任务里长期承受,模型能否和国内云、账号体系、审计流程和私有工具链接上。API 模型可以快速试用,但要进入深水区,很多公司仍会要求私有化部署、日志留存和权限隔离。 Qwen3.8 短期内仍很难成为“人人可本地跑”的模型。2.4T 总参数和 95B 激活参数决定了它更接近企业级基础设施,消费级显卡只能通过量化、切分或托管服务间接参与。短期可验证的节点很清楚:權重下载是否稳定,许可证边界是否足够清晰,SGLang 和 vLLM recipe 是否能跑出官方建议的效果,社区量化版能保留多少能力,第三方榜单是否认可官方测试口径。 阿里把 Qwen3.8-Max 先放进 Qoder 和 Token Plan,再開放 Qwen3.8-2.4T-A95B 權重,路线已经很明确:云服务承接普通用户,開放權重争夺工程社区。今天这一步给开发者留下的是一个可以开始拆解的 Max 级样本。

参考來源:ModelScope Qwen3.8-2.4T-A95B 模型卡、Qwen3.8-Max 官方博客、Qwen Cloud 模型说明、DataCamp、CocoLoop;核验權重開放状态、仓库体积、参数与激活参数口径、上下文长度、框架兼容性、thinking mode 限制、benchmark 指标和 API 服务差异。