量子化と蒸留が大規模モデルを小型デバイスで動かす中核技術に
量子化と蒸留は、大規模モデルを小型化・高速化するための二大主流技術であり、リソース制約のあるハードウェアへの展開を可能にする。
技術に関する製品動向と業界分析を全4件掲載しています。
量子化と蒸留は、大規模モデルを小型化・高速化するための二大主流技術であり、リソース制約のあるハードウェアへの展開を可能にする。
主要AIモデルが100万トークンのコンテキストウィンドウを提供するようになったが、精度とコストは依然として大きな課題である。
MiniMaxが昨年リリースした01シリーズは、Lightning Attentionという線形注意機構の派生手法を採用。計算複雑性をO(n²)からほぼO(n)に引き下げ、長文脈シナリオで大幅な速度向上を実現しつつ、競争力のある精度を維持する。
DeepSeekは大規模AIモデルの訓練において伝説的なコスト効率を達成し、V3は約550万ドル、R1のGPU使用料は約29.4万ドル。一方、米国企業は同規模のモデルに1億~10億ドルを費やしている。