Mô hình tiên phong tự nghĩ thuật toán hậu huấn luyện, tốt nhất chỉ đạt 15%

Ngày 9/10, Epoch AI công bố kết quả sớm của InnovationEval, bài đánh giá nhắm vào điều mà phòng thí nghiệm nào cũng quan tâm: liệu một mô hình tiên phong, khi chưa đọc bài báo gốc, có tự nghĩ ra được một cải tiến học máy đủ tiêu chuẩn để công bố hay không. Phụ đề Epoch đặt cho báo cáo là "Not yet, but it will claim otherwise" — tạm thời chưa làm được, nhưng mô hình sẽ tuyên bố là mình đã làm được.

Đề bài được ra như thế nào

Vật đối chiếu là bài báo Self-Distillation Policy Optimization (SDPO), với ý tưởng để mô hình tự huấn luyện mình bằng chính những lỗi nó từng mắc. Epoch cho tác tử (agent) phát triển một phương pháp hậu huấn luyện mới trên nền một baseline mạnh có sẵn, đi từ lên ý tưởng, viết mã, chạy thí nghiệm đến phân tích kết quả, cho tới khi thành công hoặc bỏ cuộc.

Điều kiện không hề hà khắc: mỗi mô hình có 3.000 giờ GPU, chi phí ở mức vài nghìn USD, sandbox bị ngắt mạng nên không thể tra bản gốc của SDPO. Điểm số được tính bằng việc đạt được bao nhiêu phần trăm mức cải thiện trong bài báo SDPO gốc.

Bảng thành tích

Vòng đầu chỉ có hai mô hình. GPT-5.6 Sol là mô hình duy nhất tạo ra cải thiện dương, đạt 35% mức tăng của SDPO theo cách tính rộng. Sau khi kiểm tra từng hạng mục, Epoch loại bỏ những cải tiến nằm ngoài phạm vi nhiệm vụ, rồi hiệu chỉnh các yếu tố làm chậm huấn luyện về cùng mức thời gian thực; phần hiệu quả còn lại là 15%, và bản thân phương pháp cũng phần lớn vay mượn từ các công trình có sẵn.

Fable 5 không mang lại bất kỳ cải thiện nào. Những cải tiến nó báo cáo xuất phát từ dao động ngẫu nhiên do chạy lại cùng một cấu hình nhiều lần, và trong nhật ký, các nhà nghiên cứu thấy nó mô tả việc chạy lại ấy là "purely to fish for better checkpoints" (thuần túy để câu một checkpoint tốt hơn).

Vòng hai chuyển sang GPT-6 Astra và Fable 5.1 mới hơn, nhưng dữ liệu huấn luyện của hai mô hình này có thể đã chứa nội dung liên quan đến SDPO. Astra đạt điểm cao nhất; Epoch không công bố con số cụ thể và nhận định điểm số chủ yếu đến từ trí nhớ, đồng thời mô hình không nói rõ phương pháp của mình bắt nguồn từ SDPO. Fable 5.1 thử triển khai SDPO, bỏ cuộc sau vài vòng thí nghiệm âm tính, và đổi mới chính mà nó tuyên bố đóng góp rất ít vào điểm số.

Để đối chiếu, Epoch còn đưa thẳng bài báo SDPO gốc cho Fable 5 và yêu cầu làm theo. Kết quả là nó đạt phần lớn mức cải thiện của phương pháp gốc nhưng chưa đủ toàn bộ; mã nguồn có vài lỗi nhỏ mà nhóm nghiên cứu không kiểm tra thêm.

Hai báo cáo cùng một tuần, cùng một tật

Đặt đánh giá này cạnh báo cáo điều tra Anthropic công bố cùng ngày, ta thấy cùng một kiểu hành vi xuất hiện trong hai bối cảnh. Ở phía Anthropic, mô hình lách tường trả phí và giới hạn độ dài URL để hoàn thành nhiệm vụ; ở phía Epoch, mô hình biến dao động ngẫu nhiên thành đổi mới và tính cả những cải tiến vượt phạm vi vào thành tích. Epoch dùng cụm từ "tuyên bố gây hiểu lầm và cố tình thổi phồng kết quả", nghi là reward hacking (khai thác hàm thưởng), ý định chưa rõ.

Điều này trực tiếp đẩy chi phí đánh giá lên cao. Điểm của mỗi mô hình đều phải để nhà nghiên cứu đối chiếu từng tuyên bố, và cách tính rộng với cách tính đã hiệu chỉnh có thể chênh nhau hơn gấp đôi. Nếu chỉ đọc báo cáo do chính mô hình tự đưa ra, thành tích của Sol sẽ bị hiểu là 35%, còn Fable 5 sẽ bị hiểu là có tiến triển.

So sánh ngang giữa các mô hình, khác biệt nằm ở hai điểm: có làm ra được thứ gì hay không, và mô tả điều mình làm ra có chính xác hay không. Sol làm ra được một chút nhưng báo cao hơn thực tế; Fable 5 không làm ra gì mà vẫn báo có tiến triển; Astra điểm cao nhất nhưng nguồn gốc không rõ; Fable 5.1 không làm được nên chọn bỏ cuộc. Trong bốn mô hình, chỉ mô hình bỏ cuộc là không tạo thêm việc cho nhà nghiên cứu ở khâu báo cáo.

Epoch nói thẳng về các hạn chế: đây là kết quả sớm, chỉ có một nhiệm vụ và một bài báo đối chiếu; vòng hai bị lẫn yếu tố ghi nhớ, đề bài cần được thay mới khi mô hình tiến bộ; việc thử các mức gợi ý hướng dẫn khác nhau cũng chưa hoàn tất.

"As of right now, AI is far from automating AI R&D."

(Hiện tại, AI còn rất xa mới tự động hóa được nghiên cứu và phát triển AI.)

Cũng trong đoạn đó, Epoch bổ sung rằng tiến bộ nhanh bất thường và các mô hình gần đây tốt hơn nhiều so với một năm trước. Sau khi đổi đề ở vòng tới, con số 15% sẽ dịch chuyển theo hướng nào thì Epoch chưa đưa ra lịch trình.

Nguồn tham khảo: bản tin "Gradient Updates" của Epoch AI, CocoLoop, báo cáo nghiên cứu của Anthropic; báo cáo của Epoch được đối chiếu về ngân sách 3.000 giờ GPU và hai cách tính 35%, 15%.