Tháng 2 năm nay, xAI ra mắt Grok 4.20 – không phải Grok 5, mà là một cấu trúc hoàn toàn khác: chạy bốn tác tử có vai trò riêng biệt trong cùng một mô hình, để chúng nghi ngờ, tranh luận lẫn nhau và cuối cùng tổng hợp ra một câu trả lời.
Ý tưởng nghe có vẻ huyền bí, nhưng đằng sau nó là một thiết kế kỹ thuật cụ thể.
Bốn vai trò, một bộ não
Trước hết về cấu trúc: Grok 4.20 không phải bốn mô hình độc lập, mà là một nền tảng MoE lớn với khoảng 3 nghìn tỷ tham số, mỗi lần suy luận kích hoạt khoảng 500 tỷ tham số. Bốn tác tử chạy trên nền tảng này thông qua các lớp thích ứng nhẹ kiểu LoRA – về bản chất là bốn "tính cách" của cùng một mô hình.
Bốn vai trò lần lượt là:
- Grok (đội trưởng): phân rã nhiệm vụ, chiến lược tổng thể, đầu ra tổng hợp cuối cùng
- Harper (nhà nghiên cứu): tìm kiếm thời gian thực và kiểm tra thực tế, kết nối nhiều với luồng thông tin của X
- Benjamin (chuyên gia logic): suy luận từng bước, tính toán, tạo và xác minh mã
- Lucas (người phản biện): chuyên tìm lỗ hổng – nhận diện thiên kiến, nghi ngờ kết luận, ngăn chặn sự tự tin thái quá
Mỗi khi gặp vấn đề đủ phức tạp, bốn tác tử này thực hiện một quy trình: phân rã nhiệm vụ → phân tích song song (dùng chung bộ nhớ đệm KV) → nhiều vòng tranh luận → tổng hợp cuối cùng.
Tranh luận không phải là trình diễn; sự tồn tại của Lucas là để phá vỡ thiên kiến xác nhận mà Grok và Benjamin có thể mắc phải.
Tỷ lệ ảo giác – con số ấn tượng
Tỷ lệ ảo giác giảm từ 12% của Grok 4.1 xuống 4,2%, mức giảm 65%.
4% là khá thấp trong số các mô hình lớn hiện nay; các mô hình hàng đầu của OpenAI và Anthropic nằm trong khoảng 5–8%.
Các số liệu khác:
| Chỉ số | Grok 4.20 |
|---|---|
| IFBench (tuân thủ chỉ dẫn) | 83%, đứng đầu |
| Tốc độ suy luận | 220,5 token/giây |
| SWE-bench (lập trình) | 75% |
| Chỉ số thông minh | Hạng 8, điểm 48 |
| Cửa sổ ngữ cảnh | 2 triệu token |
Về lập trình, 75% vẫn thua Claude Opus 4.6 với 80,8%. Xếp hạng tổng thể thứ 8, GPT-5.4 đạt 57 điểm – khoảng cách không nhỏ. Vì vậy Grok 4.20 không giành vị trí số một về "thông minh nhất", nhưng có sức cạnh tranh ở khía cạnh "nói chuyện đáng tin cậy nhất".
Tại sao nền tảng dùng chung tốt hơn nhiều mô hình hợp tác
Khung đa tác tử không phải do Grok 4.20 phát minh – LangGraph, AutoGen đã làm điều này từ lâu. Nhưng cách làm của xAI có điểm khác biệt then chốt: không phải để nhiều mô hình độc lập hợp tác, mà chạy nhiều vai trò trên cùng một nền tảng.
Lợi ích:
- Dùng chung bộ nhớ đệm KV, độ trễ thấp hơn nhiều
- Không cần truyền lượng lớn ngữ cảnh giữa các mô hình, giảm mất mát thông tin
- Tất cả tác tử có cùng hiểu biết nền tảng về cùng một đầu vào
Nói cách khác, "đa tác tử" trước đây giống như nhiều người hợp tác giải bài; Grok 4.20 giống như một người có bốn kiểu tư duy cùng hoạt động trong đầu.
Cơ sở hạ tầng
Hệ thống này chạy trên siêu máy tính Colossus của xAI tại Memphis: hơn 300.000 GPU, công suất 2 gigawatt, băng thông bộ nhớ 194 PB/giây. Cửa sổ ngữ cảnh 2 triệu token có thể chứa một kho mã nguồn lớn cùng nhiều năm tài liệu.
Một chi tiết: xAI chưa công bố số vòng tranh luận là cố định hay thích ứng – phần chi tiết kỹ thuật này vẫn là hộp đen.
Định giá và truy cập
- API: đầu vào $2/triệu token, đầu ra $6/triệu token
- Người dùng thông thường: đăng ký SuperGrok (khoảng $30/tháng) hoặc X Premium+
Giá cao hơn Claude Opus 4.6, thấp hơn GPT-5.4 một chút.
Hướng đi này đáng để nghiên cứu
Tỷ lệ ảo giác giảm mạnh cho thấy cơ chế "tự nghi ngờ" của AI có hiệu quả về mặt kỹ thuật. Đây có thể là một hướng đầu tư đáng giá hơn là chỉ tăng tham số.
Tuy nhiên, vẫn còn một số vấn đề chưa được giải đáp: logic kiểm soát số vòng tranh luận là gì? Sự nghi ngờ của Lucas có dẫn đến quá bảo thủ không? xAI chưa công bố những điều này.
Về kiến trúc, điều có thể công bố là đây là sản phẩm thương mại đầu tiên được biết đến đưa bốn tác tử tranh luận vào một nền tảng thống nhất, dùng chung bộ nhớ đệm KV – nếu hướng đi này được chứng minh hiệu quả, các ông lớn khác sẽ làm theo chỉ là vấn đề thời gian.
Nguồn tham khảo: Inside Grok 4.20: How Four Agents on One Backbone Beat Separate Models (Medium, Engineer at Heart); CocoLoop, Grok 4.20 Beta Launch: 4-Agent AI System Launches (adwaitx.com); HOW THE XAI GROK 4.20 AGENTS WORK (NextBigFuture.com); Master the 5 Core Capabilities of Grok 4.20 (Apiyi.com)