18 mô hình AI tự chạy thí nghiệm, giỏi nhất thu hẹp 82% khoảng cách với con người

Prime Intellect vừa công bố một bài đánh giá quy mô lớn: cho 18 mô hình AI tiên phong tự mình thực hiện nghiên cứu AI, tổng cộng 153 lần thí nghiệm hoàn toàn tự động, mỗi lần dùng 8 GPU H200, lần chạy dài nhất kéo dài hơn tám ngày.

Nhiệm vụ là speedrun tối ưu hóa nanoGPT, một cuộc thi cộng đồng do Keller Jordan khởi xướng: huấn luyện một mô hình GPT 124 triệu tham số xuống dưới mức mất mát validation 3,28, ai dùng ít bước huấn luyện hơn thắng. Luật chơi khá chặt – chỉ được động vào phần liên quan đến bộ tối ưu hóa, không được truy cập internet, còn lại mô hình tự lo liệu toàn bộ. Công cụ duy nhất mô hình có là một kernel IPython chạy thường trực, từ dựng quy trình thí nghiệm, viết code, chạy kiểm định cho đến tự bác bỏ giả thuyết của chính mình.

Bảng thành tích

Vạch xuất phát là 3.290 bước. Cộng đồng con người – hàng chục người mài giũa suốt nhiều tháng – đã đưa kỷ lục xuống 2.600 bước, và khoảng cách 690 bước ở giữa chính là thứ lần này cần đo.

Fable 5 đạt 2.726 bước, thu hẹp khoảng 82% khoảng cách đó. Opus 5 dừng ở 2.920 bước, Kimi K3 đạt 2.930 bước, hai mô hình này mỗi bên bù lại khoảng một nửa. GPT-5.6 Sol đạt 3.042 bước, còn GLM 5.3 không cho ra kết quả hợp lệ.

Opus 5 và Kimi K3 chỉ chênh nhau 10 bước. Tính nhanh thì 10 bước này chiếm khoảng 1,4% tổng khoảng cách, và nếu tính đến nhiễu vốn có trong huấn luyện nanoGPT cùng tính ngẫu nhiên khi lấy mẫu, thứ tự trước sau gần như không có ý nghĩa giải thích. Nói cách khác, ở những nhiệm vụ đòi hỏi tự vận hành liên tục nhiều ngày, mô hình mã nguồn mở đã bám sát nhóm dẫn đầu closed-source – Kimi K3 cũng là đại diện mã nguồn mở duy nhất lọt vào top 3.

Khoảng cách nằm ở tay nghề thực thi

Báo cáo quy sự khác biệt giữa các mô hình về khâu thực thi: chọn thí nghiệm nào để làm, làm kỹ đến đâu, diễn giải kết quả nhiễu ra sao – mỗi bước đều góp phần nới rộng khoảng cách.

Cụ thể, những mô hình làm tốt khi gặp một kết quả biên sẽ kiểm tra lại trên ba random seed trước, xác nhận ổn định rồi mới chạy validation đầy đủ; chúng cũng quay lại làm ablation, lôi những hướng từng bị đánh giá là tiêu cực ra thử lại. Một vài mô hình thậm chí tự dựng quy trình quản lý thí nghiệm và bộ mô phỏng thu nhỏ của riêng mình. Những mô hình chạy kém thường là nhìn thấy cải thiện không có thật trong nhiễu, rồi cứ thế đi theo kết luận sai.

Kết luận này không xa lạ với người làm kỹ thuật. Ngưỡng khó của việc tinh chỉnh tham số chưa bao giờ nằm ở việc đọc hiểu bài báo, mà ở việc có đủ kiên nhẫn lặp lại một kết quả khả nghi ba lần hay không.

Gáo nước lạnh: không có gì mới

Báo cáo có một câu tự trào: các tác giả nói họ lại một lần nữa bất ngờ vì sự thiếu vắng ý tưởng mới. Qua 153 thí nghiệm, các giải pháp thắng cuộc đều dùng những kỹ thuật đã có sẵn – preconditioning, lịch trình learning rate, weight averaging – không mô hình nào đề xuất một phương pháp chưa từng có ai thử.

Gáo nước này dội đúng lúc vào cuộc tranh luận gần đây về việc AI tự cải thiện chính mình. Biết làm thí nghiệm và biết đề xuất phương pháp mới là hai chuyện khác nhau: chuyện đầu đã có thể tự động hóa đến mức tám ngày không cần người can thiệp, còn chuyện sau thì trong dữ liệu này chưa thấy dấu vết.

Dữ liệu này ngoại suy được đến đâu

Còn không ít giới hạn. Bản thân speedrun nanoGPT vốn có phương sai lớn, ngân sách tính toán lại không cho phép lặp lại đủ nhiều lần với mỗi mô hình để lấy trung bình; chính tác giả cũng thừa nhận không thể phân định rạch ròi bao nhiêu phần kết quả đến từ đặc thù thiết lập của nhiệm vụ này, bao nhiêu phản ánh giới hạn thực sự của mô hình.

Một nhiệm vụ duy nhất, một lĩnh vực duy nhất, một harness cố định – đổi sang hướng nghiên cứu khác thì thứ hạng có đảo lộn hay không, hiện chưa ai dám chắc. Nhưng đưa 18 mô hình vào cùng một sandbox chạy suốt tám ngày là quy mô thí nghiệm đối chứng công khai chưa từng có trước đây; chỉ riêng việc phơi bày phương sai ra ánh sáng cũng đã hữu ích hơn một đống tự đánh giá không thể so sánh với nhau.

Nguồn tham khảo: blog nghiên cứu và kho thí nghiệm của Prime Intellect, CocoLoop, QbitAI; bảng xếp hạng nanoGPT speedrun đối chiếu số bước và mốc chuẩn của từng mô hình.