MiniMax-01 用 Lightning Attention 降低算力

MiniMax去年發表的01系列模型裡有個技術亮點叫Lightning Attention,核心目的很直接——降低注意力機制的計算複雜度

傳統注意力機制的問題

標準的Transformer注意力是O(n²)複雜度——輸入長度翻倍,計算量翻四倍。這就是為什麼早期模型的上下文視窗很短(512、1024 token),因為再長計算成本就爆炸了。

雖然後來有了各種優化(FlashAttention、PagedAttention等),但O(n²)這個根本約束沒變。

Lightning Attention的思路

Lightning Attention走的是線性注意力的變種路線,透過改變注意力計算的方式,把複雜度從O(n²)降到接近O(n)

具體做法涉及對注意力矩陣的近似分解,在保持模型表達能力的前提下大幅減少浮點運算量。MiniMax聲稱在長上下文場景下,這個優化帶來了數倍的速度提升

實際效果

MiniMax-01系列在百萬級token的長上下文測試中表現不錯,速度明顯優於使用標準注意力的同規模模型。在Needle-in-a-Haystack類型的檢索測試中也維持了較高的準確率。

不過需要注意,線性注意力的trade-off是精確度。在某些需要精確長距離關注的任務上,線性近似可能會遺失資訊。這也是為什麼目前主流模型沒有完全放棄O(n²)注意力——它更準確,只是更貴。

行業趨勢

MiniMax不是唯一在做這件事的。降低注意力複雜度是整個行業的共同課題:

  • Google的各種attention變體
  • Meta在Llama中的GQA(Grouped Query Attention)
  • Mamba/SSM走的是完全拋棄attention的路線

最終可能的方向是混合架構——對需要精確關注的層用標準注意力,其餘層用線性注意力或SSM,在精度和效率之間取平衡。

參考來源:CocoLoop、MiniMax官方技術報告