Liquid AIが投機的デコードで3.18倍高速化
Liquid AIがLFM2.5-DSparkドラフトモデルをHugging Faceで公開。オンデバイス3モデルに投機的デコードを実装し、出力を保ったまま最大3.18倍の高速化を実現した。
AI推論に関する製品動向と業界分析を全11件掲載しています。
Liquid AIがLFM2.5-DSparkドラフトモデルをHugging Faceで公開。オンデバイス3モデルに投機的デコードを実装し、出力を保ったまま最大3.18倍の高速化を実現した。
Tencent Hunyuan は AngelSpec を公開し、投機的デコード用 drafter の訓練、評価、重み、配備の流れを示した。
DeepSeekと北京大学は、生成速度を60〜85%高め、単一GPUのスループットを最大6.6倍にする推論フレームワークDSparkをオープンソース化した。
Xiaomi MiMo、通常GPUで毎秒1000トークン超を主張. 発表内容、戦略的な背景、影響を受ける利用者や企業にとっての実務上のリスクを整理する。
TensormeshはAMD Ventures、NVentures、CoreWeaveなどから2000万ドルを調達し、KVキャッシュプラットフォームを商用化。GPUの無駄な計算を削減する。
MiniMaxが推論モデルシリーズM1を公開。OpenAIのoシリーズやDeepSeekのR1に対抗し、数学・コード・論理タスクで高い性能を示す。M2.5はSWE-bench Verifiedで80.2%を達成。
OpenAI、DeepSeek、Google、Anthropicの主要AI推論モデルを徹底比較。各社のアプローチ、推論の深さと応答速度のトレードオフ、オープンソース対クローズドソースの現状を解説する。
OpenAIのGPT-5.2はARC-AGI-1で72%、ARC-AGI-2で18%を記録。現在のLLMと真の汎用知能とのギャップを浮き彫りにした。
DeepSeekは2026年1月、推論モデルR1をオープンソースとして公開。数学、コード、論理推論のベンチマークでOpenAIのo1に匹敵するスコアを達成し、蒸留版の32Bパラメータモデルはo1-miniを上回る結果を示した。
Googleは、これまでで最もインテリジェントなモデルと称するGemini 2.5 Proをリリース。数学、科学、コード、マルチモーダルベンチマークでトップスコアを記録したが、深い推論処理により応答速度が遅くなるという課題もある。
Anthropicは2月5日、質問の複雑さに応じて推論の深さを動的に調整するアダプティブシンキング、100万トークンのコンテキストウィンドウ、理論上無制限の会話を可能にするCompaction APIを搭載したOpus 4.6をリリースした。