Ox Alpha匿名上線,100萬上下文免費用

8月20日,OpenRouter的模型清單裡多了一行stealth/ox-alpha。廠商欄寫著Stealth,頁面上只有一句說明:這個模型由一家選擇保持匿名的第三方開發並營運。規格倒是全部公開:上下文視窗104萬8576個token,單次最多輸出13萬1072個token,輸入可以是文字、圖像與影片,支援函式呼叫與JSON輸出。價格欄兩個零,輸入輸出都是每百萬token 0美元。

一張兩個零的價格標籤

看流量結構比看規格參數管用。OpenRouter的應用程式排行榜上,把工作丟進Ox Alpha的前幾名是Hermes Agent、Claude Code和omp,全是agent外殼,沒有一個是聊天視窗。頁面記錄的P50延遲6.70秒,吞吐量每秒20個token,三天可用率99.50%,正常運行時間99.99%。這個速度放在對話產品裡,使用者會抱怨,放進跑一整晚的程式任務裡,沒人在意。

免費更像是拿推理成本換軌跡。104萬token的上下文加上影片輸入,再套進agent迴圈反覆呼叫工具,是所有請求類型裡最燒錢的一檔。廠商自掏這筆費用,想收的是「模型在一個真實程式庫裡連續呼叫五十次工具、失敗、重試、最後把測試跑綠」這種完整過程。這種資料在公開語料裡幾乎不存在,也沒辦法靠刷榜刷出來。頁面上那個約4.45%的工具呼叫錯誤率,只有真人真專案餵進去才測得準。

粗略算一筆帳:agent外殼單次任務動輒消耗數十萬token,一名白嫖了一週的開發者,光是推理成本就替廠商省下一份標註費——還是自帶真實業務情境、帶失敗案例的那種標註。

指紋指到了智譜

上線兩天,社群已經把範圍收得很窄。一次錯誤讓伺服端堆疊追蹤外洩,裡面出現com.wd.paas.api.domain.v4.chat.ChatCompletionRequest這條路徑,與智譜公開文件裡的介面命名對得上;錯誤碼1214在OpenRouter上的GLM系列模型裡能重現,換成DeepInfra代管的同名模型就對不上;斷詞器探測跑了30組,涵蓋多種文字系統、表情符號、程式碼與SQL,30組全部命中GLM的切分方式。做這份比對的人給自己的判斷標了0.98的可信度,指向GLM-5.3的某個變體。次要假說落在小米MiMo團隊身上。這些都還是外部推論,目前沒有任何一方出面認領。

跑分那邊只有零散樣本。一位名叫Ben Davis的開發者在DeepSWE上測出80%,同一輪裡Fable拿65%、GPT-5.6 Sol拿52%。單人單輪的結果當不了定論,不過和流量結構對得上:來的都是程式agent。

匿名上線正在變成一種發布方式

OpenRouter上的匿名模型此前已經出現過幾次。代號Hunter和Healer的兩個模型走的就是同一條路:先免費放一段時間,後來被小米MiMo團隊認領,再掛上正式價目。GLM-5和MiMo-V2-Pro也是這樣出道的。

流程穩定到可以當作一種發布方式來看——匿名期收資料、攢口碑、躲開發布會當天扎堆的橫向評測;等排行榜名次和開發者口碑站穩了,再拿掉面具改成付費。

對中國廠商而言還有一層額外的用處。模型頂著某某中國實驗室的標籤出場,海外開發者的第一反應常常先落在產地上;不署名的時候,評價只能落回程式碼本身。等身分揭曉,前面那批好評已經寫在論壇貼文和推文裡了。

免費的代價寫在頁面上。OpenRouter的資料政策一欄說明,提示詞與回傳結果由提供方保留,只承諾不用於訓練;而OpenCode的直連路線又標著零資料留存,兩處口徑在整條請求鏈上並不一致。拿它跑開源專案影響有限,把公司私有程式庫整個塞進104萬token的視窗之前,這行小字得先看清楚。

預覽期OpenRouter只說是限時實驗,沒給結束時間。什麼時候拿掉面具、拿掉之後按什麼價格賣,目前沒人給出準確消息。

參考來源:OpenRouter模型頁與提供方資料政策說明、CocoLoop、開發者社群的指紋比對紀錄與公開跑分貼文;上下文視窗、最大輸出、延遲與吞吐量以OpenRouter模型頁口徑為準,DeepSWE成績為單一開發者單輪測試。