GPT-6 Sol 与 Luna 上线,API 价格砍半

OpenAI 9 月 22 日发布 GPT-6 Sol 和 GPT-6 Luna,API 上的模型 ID 分别是 gpt-6-solgpt-6-luna,当天即可调用。两款模型的定价都是上一代 GPT-5.6 对应型号的一半,上下文窗口 110 万 token。ChatGPT 侧,Work、Pro、Business、Enterprise 和 Edu 套餐可以用到这两款模型,Luna 进入免费版和 Go 版的桌面端,Codex 与 ChatGPT Work 同步推送。OpenAI 没有放出权重,两款都只走 API。

官方给的成绩

OpenAI 在发布材料里列了几项:

  • AutomationBench 1.0.6(职业工作任务):Sol 在 xhigh 思考档拿到 33.2% 的准确率,每任务成本 0.27 美元;Luna 在 high 档比前代高 5.4 分,成本低 58%。
  • DeepSWE v1.1(编程):Sol 在 max 档 68.8%,Luna 66.6%。
  • OSWorld 2.0 离线版(电脑操作):Sol 在 xhigh 档 60.5%,官方称与 Opus 5 在中等档位相当,成本低 80%;Luna 在 max 档超过上一代的 Sol,成本约为其十分之一。
  • Agents’ Last Exam:Sol 在 max 档 56.4%。

配套还有一套改过的提示词缓存系统。OpenAI 的说法是,Agent 每一轮都要把同样的指令、工具定义和历史重发一次,新系统默认提高缓存命中率,缓存读取最高打一折。

第三方的口径:价格降了,分数没动

Artificial Analysis 的复测结论和官方材料有出入的地方,在能力这一侧。该机构称两款模型的智能指数和编码智能体指数与 GPT-5.6 基本持平:编码智能体指数上,Sol 在 max 档 57 分,比上一代高 2 分;Luna 41 分,比上一代低 2 分。

成本一侧的变化才是这次发布的主轴。同一套智能指数跑下来,Sol 在 max 档每任务 1.06 美元,上一代是 1.99 美元;Luna 0.07 美元,上一代 0.18 美元。

算一笔账

按 Artificial Analysis 这个口径粗算:一支每天跑 1 万次同类任务的团队,用 Sol 每天省下约 9300 美元,一个月接近 28 万美元;换成 Luna 这样的轻量档,同样的任务量每天成本从 1800 美元降到 700 美元。这只是把评测口径直接外推,真实账单取决于任务长度、思考档位和缓存命中率——尤其是缓存那一项,重复发送系统提示词的 Agent 应用,命中率每提高十个百分点,省下的钱比单价下调更可观。

可以对照的是同一天 Anthropic 发布的 Claude Opus 5.5,整体运行成本比 Opus 5 低 40%,单价是输入 4 美元、输出 20 美元。两家在同一天把旗舰价格往下推,Sol 的单价是 Opus 5.5 的一半,Luna 则把轻量档拉到 0.10 美元这一档位。

对国内开发者,这一轮降价的实际影响要看调用路径。走官方 API 的团队直接吃到降幅;通过中转服务或云厂商渠道调用的,加价比例是否跟着调整要等各家公告。按任务成本计价的 Agent 类产品,毛利结构会先感受到变化:同样的功能,推理支出砍半之后,此前靠限制调用次数控制成本的设计可以放宽,代价是竞品同时也能放宽。

参考来源:OpenAI 发布材料、Artificial Analysis 评测文章、CocoLoop、MarkTechPost;第三方评测核对每任务成本与编码智能体指数分数。