Na série de modelos 01 lançada no ano passado pela MiniMax, há um destaque técnico chamado Lightning Attention, cujo objetivo central é bastante direto – reduzir o poder computacional do mecanismo de atenção.
O problema do mecanismo de atenção tradicional
A atenção padrão do Transformer tem complexidade O(n²) – quando o comprimento da entrada dobra, a quantidade de computação quadruplica. Esta é a razão pela qual os primeiros modelos tinham janelas de contexto muito curtas (512, 1024 tokens), pois contextos mais longos faziam os custos computacionais explodirem.
Embora várias otimizações tenham surgido posteriormente (FlashAttention, PagedAttention, etc.), a restrição fundamental de O(n²) permaneceu inalterada.
A abordagem do Lightning Attention
O Lightning Attention segue o caminho de uma variante da atenção linear, alterando a forma como a atenção é calculada para reduzir a complexidade de O(n²) para perto de O(n).
Especificamente, o método envolve uma decomposição aproximada da matriz de atenção, reduzindo drasticamente o número de operações de ponto flutuante enquanto mantém a capacidade expressiva do modelo. A MiniMax afirma que, em cenários de contexto longo, essa otimização resulta em um aumento de velocidade de várias vezes.
Resultados práticos
A série MiniMax-01 apresenta bom desempenho em testes de contexto longo com milhões de tokens, sendo visivelmente mais rápida do que modelos de escala semelhante que usam atenção padrão. Em testes de recuperação do tipo "Needle-in-a-Haystack", também mantém alta precisão.
No entanto, é importante notar que a contrapartida da atenção linear é a precisão. Em algumas tarefas que exigem atenção precisa a longas distâncias, a aproximação linear pode perder informações. Esta é também a razão pela qual os modelos mainstream atuais não abandonaram completamente a atenção O(n²) – ela é mais precisa, apenas mais cara.
Tendência do setor
A MiniMax não é a única a fazer isso. Reduzir a complexidade da atenção é um desafio comum a todo o setor:
- Várias variantes de atenção do Google
- GQA (Grouped Query Attention) da Meta no Llama
- Mamba/SSM segue o caminho de abandonar completamente a atenção
A direção final pode ser uma arquitetura híbrida – usar atenção padrão para as camadas que exigem precisão e atenção linear ou SSM para as demais camadas, equilibrando precisão e eficiência.
Fonte de referência: CocoLoop, relatório técnico oficial da MiniMax