Reflection、5010億MoE「Beam」公開

Reflection AIが初のオープンウェイトモデル「Beam」を公開した。総パラメータ5010億、トークンあたり230億が活性化するスパースMoE(混合専門家)モデルで、コーディング、推論、エージェントタスクを主眼に置く。同社によると、重みと技術レポート、モデルカードは今月後半にApache 2.0ライセンスで公開予定。モデルは現在最終段階のレッドチーミングと評価を行っており、開発者はplatform.reflection.aiで早期アクセスを申請できる。

Reflectionは元DeepMindの研究者が創業し、1年以上ステルスモードで開発を続けてきた。今年6月にはSpaceXと総額約63億ドル(月間約1.5億ドル)規模の計算資源契約を結んだ。

どう学習させたか

公式ブログによると、Beamは52層構成で、中間学習でコンテキストウィンドウを100万トークンまで拡張した。事前学習には公開ウェブデータとライセンスデータセットから集めた23.8兆トークンを使用し、生のウェブトークンは段階的フィルタリングで約95%が除外された。

計算資源については、事前学習はNVIDIA GB300を6144基用いて4週間弱実施。その後の強化学習フェーズではGB300を1万500基に切り替え、さらに4週間実行し、1億件以上のロールアウトを生成、約13億個のサンドボックス環境を動員した。Reflectionはこの強化学習の規模に自信を見せている。

We believe this is one of the largest scale RL runs conducted by any open lab to date.

つまり、オープンな研究機関が実施した中でも最大規模の強化学習の一つだという意味だ。ブログでは、強化学習の計算量を増やすほど各能力が一貫して向上し、「頭打ちの兆しが見えない」とも述べている。

中国のオープンモデルと並べて見る

Reflectionが比較対象に据えているのはほぼ中国モデルで、その姿勢は率直だ。公式の比較表では、BeamはZhipuのGLM 5.2と互角の勝負をしつつ、推論計算量は相手の3分の1から4分の1程度と主張する。コーディングとエージェントタスクでは、パラメータ数2兆を超えるQwen 3.8-Maxに近いとしている。

いくつかの数字を見てみる:

ベンチマークBeam表内の比較
SWE-bench Verified80.9Inkling 77.6
Terminal Bench v2.180.1DeepSeek V4.1 Flash 90.6
SWE Bench Pro v2-Hard77.2Kimi K3 88.2
BrowseComp(コンテキスト付き)77.4Kimi K3 91.2
GPQA Diamond90.5Kimi K3 93.5

この表でBeamが勝っている項目は多くない。ターミナル操作、難度の高いソフトウェアエンジニアリング、ウェブ検索では、Kimi K3とDeepSeek V4.1 Flashがいずれも10ポイント前後上回る。Reflectionが打ち出す強みは効率で、活性化パラメータ230億は同スコア帯では小さく、運用コストを大きく下げられるという。

海外メディアの論調は「米国スタートアップが初めて中国トップクラスのオープンモデルと正面から渡り合えるモデルを作った」というものだ。ここ1年以上、オープンウェイトのランキング上位はDeepSeek、Qwen、Kimi、GLMが占め、米国側ではMetaが非公開の「Muse」系列に重心を移したこともあり、見劣りしない大型オープンモデルは少なかった。Beamはその空白を埋める位置づけだ。

まだ答えが出ていないこと

上記のスコアはすべてReflection自身の評価によるもので、テスト設定やサンプリング回数などの詳細は技術レポートを待つ必要がある。重みはまだ公開されておらず、コミュニティが独自に検証することはできない。

ブログはAPIの価格設定を示しておらず、どの推論プラットフォームで最初に提供されるかも明らかにしていない。「エコシステム配信パートナー」と協業するとだけ述べている。中国の開発者にとって、Apache 2.0ライセンスは重みが公開された後に自由に商用利用・微調整できることを意味するが、5010億パラメータの完全な重みはVRAM要件が高く、多くのチームは量化版かサードパーティによるホスティングを待つことになりそうだ。

参考資料:Reflection AI公式ブログ、Latent Space、CocoLoop、SiliconANGLE。パラメータ規模、学習計算量、各ベンチマークスコアはいずれもReflection公式ブログの公表データに基づく。