MiniMax-01 dùng Lightning Attention giảm sức mạnh tính toán

Trong dòng mô hình 01 ra mắt năm ngoái, MiniMax có một điểm sáng kỹ thuật mang tên Lightning Attention, với mục tiêu cốt lõi rất trực tiếp – giảm sức mạnh tính toán của cơ chế chú ý.

Vấn đề của cơ chế chú ý truyền thống

Cơ chế chú ý Transformer tiêu chuẩn có độ phức tạp O(n²) – khi độ dài đầu vào tăng gấp đôi, khối lượng tính toán tăng gấp bốn. Đây là lý do tại sao các mô hình thời kỳ đầu có cửa sổ ngữ cảnh rất ngắn (512, 1024 token), bởi nếu dài hơn, chi phí tính toán sẽ bùng nổ.

Mặc dù sau này đã có nhiều cải tiến (FlashAttention, PagedAttention, v.v.), nhưng ràng buộc cơ bản O(n²) vẫn không thay đổi.

Hướng tiếp cận của Lightning Attention

Lightning Attention đi theo hướng biến thể của cơ chế chú ý tuyến tính, bằng cách thay đổi cách tính toán chú ý, đưa độ phức tạp từ O(n²) xuống gần O(n).

Cụ thể, phương pháp này liên quan đến việc phân tích xấp xỉ ma trận chú ý, giúp giảm đáng kể số lượng phép toán dấu phẩy động trong khi vẫn duy trì khả năng biểu diễn của mô hình. MiniMax tuyên bố rằng trong các kịch bản ngữ cảnh dài, tối ưu hóa này mang lại tốc độ nhanh hơn gấp nhiều lần.

Hiệu quả thực tế

Dòng MiniMax-01 hoạt động tốt trong các bài kiểm tra ngữ cảnh dài hàng triệu token, với tốc độ vượt trội so với các mô hình cùng quy mô sử dụng cơ chế chú ý tiêu chuẩn. Trong các bài kiểm tra truy xuất dạng "Needle-in-a-Haystack", chúng cũng duy trì độ chính xác cao.

Tuy nhiên, cần lưu ý rằng sự đánh đổi của cơ chế chú ý tuyến tính là độ chính xác. Trong một số tác vụ yêu cầu chú ý chính xác đến các mối quan hệ xa, phép xấp xỉ tuyến tính có thể làm mất thông tin. Đây cũng là lý do tại sao các mô hình chủ đạo hiện nay chưa hoàn toàn từ bỏ cơ chế chú ý O(n²) – nó chính xác hơn, chỉ là đắt hơn.

Xu hướng ngành

MiniMax không phải là công ty duy nhất làm điều này. Giảm độ phức tạp của cơ chế chú ý là bài toán chung của toàn ngành:

  • Các biến thể chú ý khác nhau của Google
  • GQA (Grouped Query Attention) của Meta trong Llama
  • Mamba/SSM đi theo hướng loại bỏ hoàn toàn cơ chế chú ý

Hướng đi cuối cùng có thể là kiến trúc lai – sử dụng cơ chế chú ý tiêu chuẩn cho các lớp cần độ chính xác cao, và cơ chế chú ý tuyến tính hoặc SSM cho các lớp còn lại, nhằm cân bằng giữa độ chính xác và hiệu quả.

Nguồn tham khảo: CocoLoop, báo cáo kỹ thuật chính thức của MiniMax