Grok 4.7不涨价,单任务token却翻倍

SpaceXAI 9 月 21 日发布 Grok 4.7,官方称它是自家”在编程和知识工作上能力最强的模型”。API 价格和速度与 Grok 4.6 持平:每百万输入 token 2 美元、输出 6 美元,另有一档价格翻倍、输出速度翻倍的快速版本。模型已在 Cursor、Grok Build、API 控制台和第三方平台上线。

“our most capable model for coding and knowledge work.”

官方对 Grok 4.7 的定位是编程与知识工作。

官方说新模型换了比 4.6 更大的基座,强化学习训练拉长,重点练的是持续数小时的长任务,更擅长自我校验和处理长上下文,也和 Grok Bot 做了原生打通。

官方跑分和第三方评测

SpaceXAI 自己公布的几项:DeepSWE v1.1 71.0%,CursorBench 4.0 46.3%,Terminal-Bench 4.0 37.6%,电气工程类的 EEBench 64.0%。安全方面,官方称拒答和越狱抵抗能力在业内领先,风险提示放行率在 HackerBench v0.3 上是 3.3%,红队能力以邀请制对部分网络安全伙伴开放。

第三方评测机构 Artificial Analysis 给的结果:综合智能指数 46 分,比 4.6 高 2 分;搭配 Grok Build 的编码智能体指数 56 分,比 4.6 高 9 分。分项里 DeepSWE v1.1 从 65% 升到 73%,Terminal-Bench 4.0 从 18% 升到 33%,SWE-Atlas-QnA 从 58% 升到 63%。按这份评测,Grok 4.7 加 Grok Build 在编码智能体上排第四,前面是 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。长程知识工作基准 AA-Briefcase 上它拿到 1657 Elo,比 4.6 高 111。

官方发布页没有给出和竞品的横向排名,SpaceXAI 也没有回应第三方评测里的名次。

算一笔用量账

价格表没动,可 Artificial Analysis 记录的 token 用量变了:Grok 4.7(xhigh 档)每个任务平均输出约 8.1 万 token,4.6 同档约 3.8 万,涨了 125%。输出速度约每秒 188 token,平均一个任务跑 7.1 分钟。

粗算一下,只看输出,一个任务在 4.6 上约 0.23 美元,在 4.7 上约 0.49 美元。标价持平,按任务计的花费翻了一倍多,分数的提升有相当一部分是用”想得更久”换来的。

放到本周的价格表里,这个账更显眼。Grok 4.7 发布后第二天,Anthropic 的 Claude Opus 5.5 和 OpenAI 的 GPT-6 Sol 先后上线:Opus 5.5 每百万 token 输入 4 美元、输出 20 美元,GPT-6 Sol 降到 2 美元和 10 美元。按每百万 token 标价看,Grok 4.7 的输出单价仍然最低;按每个任务的实际花费算,差距会缩小多少,要看另外两家的 token 用量,这部分第三方数据还没出齐。

Grok 4.7 的 46 分出来不到两天,Opus 5.5 和 GPT-6 两代新模型就进了 Artificial Analysis 的评测队列,排名表的上半截还会再变。

参考来源:SpaceXAI 官方发布页、CocoLoop、Artificial Analysis 评测报告;API 标价与官方跑分以 SpaceXAI 发布页核验,智能指数、编码智能体指数与 token 用量以 Artificial Analysis 口径核验,单任务输出费用为按标价粗算。