Ox Alpha匿名上线,100万上下文免费用

8 月 20 日,OpenRouter 的模型列表里多了一行 stealth/ox-alpha。厂商栏写着 Stealth,页面上只有一句说明:这个模型由一家选择保持匿名的第三方开发和运营。规格倒是全部公开:上下文窗口 1,048,576 个 token,单次最多输出 131,072 个 token,输入可以是文本、图像和视频,支持函数调用与 JSON 输出。价格一栏两个零,输入输出都是每百万 token 0 美元。

一张两个零的价格标签

看流量结构比看参数管用。OpenRouter 的应用榜上,往 Ox Alpha 里灌活儿的前几名是 Hermes Agent、Claude Code 和 omp,全是 agent 壳子,没有一个是聊天窗口。页面记录的 P50 延迟 6.70 秒,吞吐每秒 20 个 token,三天可用性 99.50%,正常运行时间 99.99%。这个速度放在对话产品里用户会骂街,放在跑一整夜的编程任务里没人在意。

免费更像是拿推理成本换轨迹。 100 万 token 的上下文加上视频输入,再套进 agent 循环反复调工具,是所有请求类型里最烧钱的一档。厂商自掏这笔钱,想收的是”模型在一个真实仓库里连着调五十次工具、失败、重试、最后把测试跑绿”这种完整过程。这种数据公开语料里几乎不存在,也没法靠刷榜刷出来。页面上那个约 4.45% 的工具调用错误率,只有真人真项目喂进去才测得准。

粗算一笔:agent 壳子单次任务动辄消耗几十万 token,一个白嫖了一周的开发者,光推理成本就替厂商省下了一份标注费——还是自带真实业务上下文、带失败案例的那种标注。

指纹指到了智谱

上线两天,社区已经把范围收得很窄。一次报错让服务端栈跟踪漏了出来,里面出现 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest 这条路径,与智谱公开文档里的接口命名对得上;错误码 1214 在 OpenRouter 上的 GLM 系列模型里能复现,换成 DeepInfra 托管的同名模型就对不上;分词器探针跑了 30 组,覆盖多种文字系统、emoji、代码和 SQL,30 组全部命中 GLM 的切分方式。做这份比对的人给自己的判断标了 0.98 的置信度,指向 GLM-5.3 的某个变体。次要假说落在小米 MiMo 团队身上。这些都还是外部推断,眼下没有任何一方出面认领。

跑分那边只有零散样本。一位叫 Ben Davis 的开发者在 DeepSWE 上测出 80%,同一轮里 Fable 拿 65%、GPT-5.6 Sol 拿 52%。单人单轮的结果当不了定论,不过和流量结构对得上:来的都是编程 agent。

匿名上线正在变成一种发布方式

OpenRouter 上的匿名模型此前已经出现过几次。代号 Hunter 和 Healer 的两个模型走的就是同一条路:先免费放一段时间,后来被小米 MiMo 团队认领,再挂上正式价目。GLM-5 和 MiMo-V2-Pro 也这么来过。

流程稳定到可以当作一种发布方式来看——匿名期收数据、攒口碑、躲开发布会当天扎堆的横评;等排行榜位次和开发者口碑站住了,再摘面具改成付费。

对中国厂商还有一层额外的用处。模型顶着某某中国实验室的标签出场,海外开发者的第一反应常常先落在产地上;不署名的时候,评价只能落回代码本身。等身份揭晓,前面那批好评已经写在论坛帖和推文里了。

免费的代价写在页面上。OpenRouter 的数据政策一栏说明,提示词和返回结果由提供方保留,只承诺不用于训练;而 OpenCode 的直连路线又标着零数据留存,两处口径在整条请求链上并不一致。拿它跑开源项目影响有限,把公司私有仓库整个塞进 100 万 token 的窗口之前,这行小字得先看清楚。

预览期 OpenRouter 只说是限时实验,没给结束时间。什么时候摘面具、摘下来之后按什么价卖,眼下没人给准信。

参考来源:OpenRouter 模型页与提供方数据政策说明、CocoLoop、开发者社区的指纹比对记录与公开跑分帖;上下文窗口、最大输出、延迟与吞吐以 OpenRouter 模型页口径为准,DeepSWE 成绩为单个开发者单轮测试。