Dans la série de modèles 01 publiée l'année dernière par MiniMax, il y a un point fort technique appelé Lightning Attention, dont l'objectif principal est très direct : réduire la puissance de calcul du mécanisme d'attention.
Le problème du mécanisme d'attention traditionnel
L'attention standard du Transformer a une complexité de O(n²) – lorsque la longueur d'entrée double, la quantité de calcul quadruple. C'est la raison pour laquelle les premiers modèles avaient des fenêtres de contexte très courtes (512, 1024 tokens), car des contextes plus longs faisaient exploser les coûts de calcul.
Bien que diverses optimisations soient apparues par la suite (FlashAttention, PagedAttention, etc.), la contrainte fondamentale de O(n²) n'a pas changé.
L'approche de Lightning Attention
Lightning Attention suit la voie d'une variante de l'attention linéaire, en modifiant la façon dont l'attention est calculée pour réduire la complexité de O(n²) à presque O(n).
Concrètement, la méthode implique une décomposition approximative de la matrice d'attention, réduisant considérablement le nombre d'opérations en virgule flottante tout en préservant la capacité d'expression du modèle. MiniMax affirme que, dans les scénarios de contexte long, cette optimisation apporte un gain de vitesse multiple.
Résultats pratiques
La série MiniMax-01 obtient de bons résultats dans les tests de contexte long avec des millions de tokens, étant nettement plus rapide que les modèles de taille similaire utilisant l'attention standard. Dans les tests de récupération de type "Needle-in-a-Haystack", elle maintient également une haute précision.
Cependant, il faut noter que le compromis de l'attention linéaire est la précision. Dans certaines tâches nécessitant une attention précise sur de longues distances, l'approximation linéaire peut perdre des informations. C'est aussi la raison pour laquelle les modèles dominants actuels n'ont pas complètement abandonné l'attention O(n²) – elle est plus précise, seulement plus coûteuse.
Tendance du secteur
MiniMax n'est pas le seul à faire cela. Réduire la complexité de l'attention est un défi commun à tout le secteur :
- Diverses variantes d'attention de Google
- GQA (Grouped Query Attention) de Meta dans Llama
- Mamba/SSM suit la voie de l'abandon total de l'attention
La direction finale pourrait être une architecture hybride – utiliser l'attention standard pour les couches nécessitant une précision élevée et l'attention linéaire ou SSM pour les autres couches, afin d'équilibrer précision et efficacité.
Source de référence : CocoLoop, rapport technique officiel de MiniMax