Reflection AI發布了第一款開源權重模型Beam。這是一個稀疏混合專家(MoE)模型,總參數5010億,每個token啟動230億,主打程式設計、推理和智能體任務。官方表示權重、技術報告和模型卡會在這個月稍晚發布,授權方式採用Apache 2.0;模型目前還在進行最後一輪紅隊測試和評估,開發者可以先到platform.reflection.ai申請搶先體驗。
Reflection由前DeepMind研究員創辦,先前潛行開發了一年多。今年6月,它向SpaceX訂購了總額約63億美元的運算資源,每個月約1.5億美元。
怎麼訓練出來的
根據官方部落格的說法,Beam共有52層,中期訓練把上下文擴展到100萬token。預訓練用了23.8兆token,來源包括公開網頁和授權資料集;原始網頁token經過分級過濾,大約95%被丟掉。
在運算方面,預訓練在6144塊NVIDIA GB300上跑了不到四週;接下來的強化學習階段換成1萬500塊GB300,又跑了四週,產生超過1億筆rollout,動用了大約13億個沙盒環境。Reflection對這次強化學習的規模相當有信心:
We believe this is one of the largest scale RL runs conducted by any open lab to date.
意思是,他們認為這是目前開放實驗室做過規模最大的強化學習之一。部落格還提到,強化學習的運算量一路往上加,各項能力也跟著一路成長,「看不到有平台期的跡象」。
跟中國開源模型放在一起看
Reflection的對標對象幾乎全是中國模型,這點講得很直接。官方給出的對比表裡,Beam跟智譜GLM 5.2打得有來有回,同時宣稱推理運算量只用了對方的三分之一到四分之一;在程式設計和智能體任務上,它說自己接近參數量超過2兆的Qwen 3.8-Max。
挑幾項來看:
| 基準測試 | Beam | 表內對比 |
|---|---|---|
| SWE-bench Verified | 80.9 | Inkling 77.6 |
| Terminal Bench v2.1 | 80.1 | DeepSeek V4.1 Flash 90.6 |
| SWE Bench Pro v2-Hard | 77.2 | Kimi K3 88.2 |
| BrowseComp(含上下文) | 77.4 | Kimi K3 91.2 |
| GPQA Diamond | 90.5 | Kimi K3 93.5 |
這張表裡Beam贏的項目不多。在終端操作、高難度軟體工程和網頁搜尋上,Kimi K3和DeepSeek V4.1 Flash都領先十個百分點左右。Reflection主打的賣點是效率:啟動參數230億,在同檔分數裡算小的,部署成本能低上一截。
海外媒體的敘事是「美國創業公司第一次做出能跟中國頭部開源模型正面對比的模型」。過去一年多,開源權重排行榜的前段基本被DeepSeek、Qwen、Kimi、GLM佔著,美國這邊Meta把重心轉向閉源的Muse系列之後,拿得出手的大型開源模型已經不多。Beam補的就是這個位置。
還沒回答的幾件事
上面所有分數都來自Reflection自己的評測,測試設定、取樣次數這些細節要等技術報告才知道。權重還沒放出來,社群沒辦法獨立跑分驗證。
部落格沒有提供任何API定價,也沒說會在哪些推理平台首發,只提到會跟「生態系配送夥伴」合作。對中國開發者來說,Apache 2.0授權意味著權重放出後可以自由商用和微調,不過5010億參數的完整權重對顯示卡記憶體的要求不低,多數團隊大概還是得等量化版本或第三方代管。
參考來源:Reflection AI官方部落格、Latent Space、CocoLoop、SiliconANGLE;參數規模、訓練運算量與各項基準分數均以Reflection官方部落格公布的數據為準。