Baseten、AIエージェントでvLLM超える推論エンジン

推論基盤企業Basetenは10月2日、エンジニアリングブログで発表した。Claude CodeでFable 5を駆動し、AIエージェントに単一モデル専用の推論エンジンをゼロから書かせたところ、テストしたすべてのトラフィックパターンでvLLMを上回ったという。

このエンジンはVibeQwenと呼ばれ、アリババのQwen-3.6-35B-A3Bを専用に処理する。筆者のShawn Rushefskyは記事内でこう書いている。

"the generated engine, called VibeQwen, outperformed vLLM across all tested traffic patterns, and by very large margins in some cases"

(生成されたエンジンVibeQwenは、テストしたすべてのトラフィックパターンでvLLMを上回り、場合によっては非常に大きな差がついた)

数値の測定方法

テスト環境はNvidia B200、比較対象はvLLM 0.25.1、負荷テストツールはAIPerfを使用した。結果は以下の通り。

  • シングルストリームデコードで1792TPSを記録、vLLMの943TPSに対し約90%高速;
  • 初回トークン遅延は28ミリ秒から12ミリ秒へ、約2.3倍に短縮;
  • 32並列時のスループットは71%高かった。

コスト面では、VibeQwenの開発には前後約1週間かかり、約17億トークン(大半はキャッシュヒット)、B200換算で約200時間を消費し、総費用は数千ドル規模だった。

同じ手法を画像セグメンテーションでも一度試している。2つ目の成果物はSammieと呼ばれ、MetaのSAM 3.1を処理し、H100上で動作する。開発は数日で完了し、費用は数百ドル、約2億トークンを消費した。32並列時のスループットはMeta公式リファレンスサーバーより50%高く、1秒あたり91枚の画像処理を達成した。

エージェントは何をしたのか

BasetenはMetaInferという自社フレームワークを完全なサービングスタックに拡張し、その穴埋めをエージェントに任せた。エージェントは既存のオープンソース実装を参考にでき、変更を加えるたびにAIPerfで負荷テストを行い、数値を基に次の一手を決めた。

特に具体的に書かれた制約が一つある。出力精度に影響する可能性のある変更があれば、エージェントは必ず停止し、人間の承認を求めなければならない。数値のわずかなドリフトは推論エンジンで最も見つけにくい問題であり、精度を犠牲にした高速化はベンチマークのスコアだけでは見抜けない。このゲートはまさにそれを防ぐためのものだ。

ブログ記事自体も境界線を引いている。VibeQwenとSammieはいずれも実験的なものであり、本番トラフィックを処理した経験はない。Sammieの比較はより粗く、筆者自身もその数値は「示唆的な証拠」にとどまると認めている。両者はアーキテクチャもアクセラレータも異なり、対照実験も行われていない。

中国のAIチームへの意味

VibeQwenが対象とするのはオープンソースのQwenモデルであり、中国国内の多くの本番サービスも偶然Qwen+vLLMまたはSGLangの組み合わせで動いている。つまりこの数値は多くのチームの日常業務に直結する。

両アプローチの経済性を比較する価値がある。汎用エンジンは数百種類のモデル構造に対応しなければならず、単一構造向けの積極的な最適化の多くは組み込めない。専用エンジンは一つのモデルだけに集中できるため、アテンションカーネル、MoEルーティング、スケジューリング戦略をすべて35B-A3Bの形状に合わせて設計できる。かつて専用エンジンを書くにはチームで数ヶ月かかったが、Basetenは今回それを1週間、数千ドルまで圧縮した。粗い計算では、推論エンジニア1人の1ヶ月分の人件費より安い。

  1. エンジンはモデルに固定される。Qwenがアップグレードされ構造が変われば、エンジンはほぼ再生成が必要になる。
  2. テストはB200のみ。中国国内で入手できるアクセラレータは種類が多様で、同じ手法が他のハードウェアで再現できるかについてブログはデータを示していない。
  3. 本番環境で求められるロングテールの安定性、メモリ断片化、異常リクエストへの対応は、負荷テストでは必ずしも検証できない。

それでも、「主力モデルごとに自動生成した専用エンジンを用意する」というアプローチには、検証可能な一例ができたことになる。vLLMの位置づけが「本番の主力」から「基準線とフォールバック」へ後退するかどうかは、こうしたエンジンを実際に本番環境へ投入し、数ヶ月分のデータを公開するチームが現れるかにかかっている。

参考資料:Basetenエンジニアリングブログ、CocoLoop;TPS、初回トークン遅延、並列スループット、トークン消費量、GPU時間はBasetenブログの記述に基づく。