Arcee AI 是一家只有 26 人的小公司,但他們剛做了一件讓業界許多人吃驚的事:花了公司大約一半的風險投資,2000 萬美元,用 2048 塊 Nvidia B300 GPU 跑了 33 天,訓練出一個 400 億參數的開源推理模型——Trinity-Large-Thinking。
模型的 Agent 任務表現相當不錯:在 Tau2-Airline 基準上拿下第一(88 分),在 PinchBench 上拿下第二(91.9 分,Anthropic 的 Claude Opus 4.6 是 93.3 分),AIME25 數學推理跑出 96.3 分。全程採用 Apache 2.0 開源協議,可商用、可下載、可修改。
不是大力出奇蹟,而是 MoE 架構用到極致
Trinity-Large-Thinking 是一個混合專家模型(MoE),總參數 400 億,但每次推理只激活約 13 億——用了 256 個專家,每次只選 4 個激活。這意味著它擁有大模型的「知識儲量」,但推理速度和資源佔用接近小模型。
訓練數據是 17 兆 tokens,其中超過 8 兆是合成生成的。這個比例在現在的高品質開源模型裡已經很常見了。
更技術層面的亮點是他們自行研發的 SMEBU(Soft-clamped Momentum Expert Bias Updates)演算法,專門解決大規模 MoE 訓練中的「專家崩潰」問題。整個 17 兆 token 的訓練過程「零損失尖峰」——對大模型訓練來說這很難得,很多 MoE 訓練到中途會出現突然的 loss 爆炸。
哪裡強,哪裡有差距
老實說,Trinity-Large-Thinking 不是全面超越 Claude Opus,而是在特定場景打出了成績。
| 基準 | Trinity-Large-Thinking | Claude Opus 4.6 |
|---|---|---|
| Tau2-Airline | 88(第一) | 未公開 |
| PinchBench | 91.9(第二) | 93.3 |
| AIME25 | 96.3 | — |
| GPQA-Diamond | 76.3 | 89.2 |
| MMLU-Pro | 83.4 | 89.1 |
Agent 任務能接近頂尖水準,通用推理還有約 13 個百分點的差距。但考慮到這是開源且可本地部署的模型,這個差距已經很小了。
另外他們還同步發布了 Trinity-Large-TrueBase——保留了指令微調之前的純預訓練狀態的「原始檢查點」版本。這種版本對做 AI 基礎研究的人很有價值,可以研究 RLHF 和指令微調對模型行為的具體影響。
更大的背景:美國開源 AI 缺席太久了
過去一年,開源大模型榜單基本上是中國公司的主場:DeepSeek、Qwen、Kimi、GLM,每隔幾個月都有新東西衝上來。美國這邊一直是 Llama 一家獨撐,但 Meta 最近把部分新模型閉源,開源社群對此頗有微詞。Arcee 這次填的就是這個空缺。
CEO Mark McQuade 說這個模型的目標用戶是企業:可以本地部署、可以客製化、不用把資料發送給雲端服務商。對有資料合規要求的金融、醫療、政府機構來說,「可以跑在自己伺服器上」這個特性,有時候比 benchmark 分數更實用。
26 個人,2000 萬美元,33 天,400 億參數。
小公司做大事這件事,在 AI 圈還沒死。
參考來源:Arcee AI spent half its venture capital to build an open reasoning model that rivals Claude Opus in agent tasks(The Decoder);Tiny startup Arcee AI built a 400B-parameter open source LLM from scratch to best Meta's Llama(TechCrunch);CocoLoop、Arcee aims to reboot U.S. open source AI with new Trinity models released under Apache 2.0(VentureBeat)