GitHubで3万7000超のスター、4000超のフォークを集めているオープンソース推論エンジン「Colibrì」。やっていることは単純明快で、数千億から1兆超のパラメータを持つMoE大規模モデルを、普通の人のパソコンで動かすというものだ。智譜(Zhipu AI)のGLM-5.2を例に挙げると、プロジェクトが示す最小要件はメモリ16GB、推奨は24GBで、GPUはなくてもよい。
プロジェクトはVincenzo Fornaro氏が7月1日に立ち上げ、C言語のみで書かれ、外部依存はゼロ、ライセンスはApache 2.0。9月20日リリースのv1.12.0では81件のプルリクエストがマージされ、9月24日のv1.12.1ではさらに96件、うち80件が外部コントリビューターによるものだった。
重みはディスクに置き、必要な層だけ読む
MoEモデルはパラメータ総数は多いが、1トークンあたりに実際使う量はわずかという特徴を持つ。GLM-5.2は総パラメータ7440億のうち、1回の呼び出しで活性化するのは約400億のみ。Colibrìはモデル全体をメモリに載せず、int4量子化した完全な重みをNVMe SSDに置くという発想を取る。GLM-5.2で約372GB、GLM-5.3で約419GBとなる。
プロジェクトはVRAM・メモリ・SSDを一体化したストレージ階層として扱い、作者はこれを「重みのジャストインタイムコンパイル」と呼ぶ。具体的な手法としては、層ごとの最近最少使用(LRU)キャッシュ、高頻度で使う専門家(エキスパート)を常駐固定、次の層で使われそうな専門家を1層先読みでプリフェッチ、複数トークンが必要とする専門家をまとめて1回のディスク読み込みに統合、ディスク読み込みと計算のオーバーラップ、さらに2台のSSDへのストライピング並列読み込みにも対応する。
READMEには速度面のトレードオフが明記されている。高速ストレージが足りなければ遅くなるだけでモデルの精度は落ちない、速度については「一切保証しない」としている。
実際どこまで速いのか
プロジェクトはいくつかの実測値を公開している。
- RTX 5090を6枚使用、重みを全て常駐させた場合:毎秒5.8~6.8トークン
- メモリ128GBのCPUのみのデスクトップ機、キャッシュのウォームアップ後:毎秒約1.8トークン
- RTX 5070 Ti単体:毎秒1.07トークン
- 作者のメモリ25GB開発機、コールドスタート時:毎秒0.05~0.1トークン
9月中旬リリースのv1.11.0ではDeepSeek V4.1 Flash(パラメータ5520億、ディスク使用量510GB)に対応し、CPUのみのマシンで公式重みをそのまま読み込み、フォーマット変換は行わない。作者の記録では、コールドスタート時の1ターンあたりの所要時間が78.7秒から25.1秒に短縮され、5ターンの対話では毎秒1.14~1.58トークンで安定した。
v1.12.0の主要新機能は「brioモード」と呼ばれる。呼び出し側があらかじめ選択肢を与えると、エンジンはテキストをサンプリング生成する代わりに各選択肢の確率をそのまま読み出す。出力トークン数はゼロになり、答えが与えられた選択肢の外に出ることはあり得ない。多くのローカル利用者にとっては、1文字ずつ返信を待つより実用的だ。
対応モデル一覧はほぼ中国製オープンモデルの顔ぶれ
Colibrìは現在、9つのモデルファミリーに対応している。GLM-5.2/5.3および視覚対応のGLM-5.3-Flash、DeepSeek V4 FlashとV4.1 Flash、Kimi K3、Qwen3.6とQwen3.8-Flash-Next、そしてInklingとOLMoE。最後の2つを除くすべてが智譜(Zhipu AI)、DeepSeek、月之暗面(Moonshot AI)、アリババという中国企業由来だ。
中国国内の開発者にとって、これには2つの実用的な意味がある。一つはデータを社内に留められること。法律事務所や病院、製造業のようにドキュメントをクラウドに送れない現場でも、メモリ128GBのワークステーションに1TBのSSDを1台加えれば、7440億パラメータのGLMをローカルで動かせる。もう一つは参入障壁の低下だ。2兆8000億パラメータのKimi K3はint4重みで約1.6TB、メモリ要件は32GB以上で、これまで個人が自分のマシンで動かすことはほぼ不可能だった。
限界も同じくらいはっきりしている。毎秒1~2トークンという速度では、千文字程度の返信を生成するのに10数分かかる。SSDへの長時間・高強度なランダム読み込みによる寿命への影響について、プロジェクトの文書は試算を示していない。作者自身も、投機的デコードによる高速化はあくまで実測結果であり、別のマシンで同じ結果になるとは限らないと注意を促している。
参考資料:ColibrìプロジェクトのREADME、Colibrì v1.11~v1.12.1のリリースノート、量子位(QbitAI)、CocoLoop。速度の数値はプロジェクト側が公表した各実測構成に基づき、スター数はGitHubページの数値を採用した。