OpenAI chỉnh lại số liệu Astra, tỷ lệ ảo giác quay về 4,2%

Theo Fortune đưa tin ngày 4/9, sau khi bài blog công bố mô hình GPT-6 Astra của OpenAI lên mạng, dữ liệu đánh giá trên trang đã bị chỉnh sửa nhiều lần, một số chỉ số bị sửa rồi lại sửa về như cũ.

Có thể đối chiếu dòng thời gian theo từng bản lưu của Internet Archive. Vào 2 giờ chiều giờ miền Đông nước Mỹ ngày 3/9, bài blog được đăng lần đầu rồi bị gỡ xuống; bản lưu đầu tiên được ghi lại lúc 2 giờ 23 phút; đến 3 giờ 32 phút, tài khoản X của OpenAI đăng đường link nhưng liên kết đó bị lỗi; 3 giờ 50 phút Sam Altman chia sẻ lại; đến bản lưu thứ sáu lúc 5 giờ 20 phút, các con số trong bảng đã thay đổi. Sang ngày 4/9, số liệu vẫn tiếp tục biến động.

Những mục nào đã bị thay đổi

Cột tỷ lệ ảo giác thay đổi rõ nhất. Astra được sửa từ 4,2% xuống 2,0%, sau đó lại đổi về 4,2%; mô hình đối chứng GPT-5.6 Sol từ 12,2% sửa xuống 9,4%, rồi cũng quay lại 12,2%. Một lần giảm rồi một lần trở lại, vị trí tương đối giữa hai mô hình không đổi, nhưng phiên bản ảnh chụp màn hình lan truyền ở giữa đã làm khoảng cách trông nhỏ hơn phân nửa.

Cột toán học thay đổi lại là điểm của đối thủ. Trên FrontierMath Tier 4 v2, điểm 97,6% của chính Astra không hề thay đổi; điểm của Fable 5.1 (Anthropic) bị chỉnh từ 87,8% xuống 78%, rồi dừng lại ở 83%; GPT-5.6 Sol bị chỉnh từ 83% xuống 80,5%, sau đó cũng quay về 83%. Có lúc điểm của đối thủ bị cắt giảm gần 10 điểm phần trăm.

Về an ninh mạng, điểm ExploitBench của GPT-5.6 Sol được điều chỉnh tăng từ 5,5% lên 11,5%. Mục này có bị đổi lại hay không, Fortune cho biết vẫn đang xác minh khi bài viết lên sóng.

Ngoài ra, điểm ARC-AGI-3 trong bản trước khi được phép công bố là 98,6%, nhưng khi chính thức phát hành lại ghi là 99,99%; mục lập trình cũng có một thay đổi nhỏ, từ 57,7% thành 57,9%.

Người phát ngôn của OpenAI phản hồi: "We care deeply about getting evaluations right. Most evaluations have noise within a few percentage points..." (chúng tôi rất coi trọng việc đánh giá cho chính xác, phần lớn các bài đánh giá vốn có nhiễu trong khoảng vài điểm phần trăm).

Các nhà nghiên cứu bên ngoài không có chung quan điểm. Anka Reuel và Mike Hardy nhận định: "This can be done in a very tight timeframe, and it's better for their marketing." (việc này có thể thực hiện trong khung thời gian rất ngắn, và có lợi hơn cho hoạt động marketing của họ). Còn Vincent Sunn Chen của Snorkel AI lại nghiêng về cách giải thích quy trình: "It's usually a function of final launch logistics." (thường đây chỉ là hệ quả của khâu hậu cần trong giai đoạn ra mắt cuối cùng).

Những con số này được đo trong điều kiện nào

Ở chân trang blog có một dòng miễn trừ trách nhiệm: "Evaluation scores are the maximum at any effort" — các điểm số lấy theo kết quả tốt nhất ở bất kỳ mức đầu tư tính toán nào. Trọng lượng của câu này còn lớn hơn bất kỳ lần chỉnh sửa nào trong bảng.

ARC-AGI-3 là ví dụ rõ nhất cho sự khác biệt đó. Theo kết quả tự đo của Arc Prize Foundation: khi dùng harness (bộ khung điều phối) mạnh, điểm đạt 99,9%; đổi sang harness tiêu chuẩn thì chỉ còn 63%. Cùng một mô hình, cùng một bộ đề, chênh nhau tới 36 điểm phần trăm, khác biệt nằm ở lớp mã điều phối bên ngoài.

Với độc giả theo dõi qua cộng đồng nói tiếng Trung, lớp thông tin này thường bị rơi rụng trong quá trình lan truyền. Bảng điểm khi lan tới đó phần lớn chỉ còn lại con số và ảnh chụp thứ hạng, còn cấu hình harness, mức đầu tư tính toán (effort), số phiên bản đánh giá đều không đi kèm. Trong khi đó, điều người dùng phổ thông thực sự trải nghiệm là ChatGPT hay API ở chế độ mặc định sau khi đã đóng gói sản phẩm, cách xa "giá trị tối đa ở bất kỳ mức đầu tư nào" tới nhiều lớp.

Fortune cũng đề cập rằng system card của OpenAI thiếu tài liệu phương pháp đánh giá chi tiết, khiến việc tái lập kết quả từ bên ngoài trở nên khó khăn. Còn ai là người khởi xướng những lần chỉnh sửa này, dựa trên căn cứ nào, tài liệu công khai không hề nói rõ, và phản hồi của OpenAI cũng không đề cập đến điều đó.

Phần duy nhất có thể đối chiếu là bản lưu trữ

Bằng chứng chắc chắn duy nhất trong sự việc này là sáu bản lưu trữ internet. Chúng có thể chứng minh số liệu đã thay đổi, thay đổi vào lúc nào, đổi thành bao nhiêu — nhưng không thể chứng minh động cơ đằng sau.

Bảng đánh giá công bố vào ngày ra mắt vẫn thường được xem như một sự kiện báo chí có thể trích dẫn trực tiếp, đó là cách làm mặc định trong ngành. Trường hợp của Astra lần này cho thấy: khi trích dẫn, tốt nhất nên kèm theo thời điểm thu thập dữ liệu.

Nguồn tham khảo: Fortune, CocoLoop, Arc Prize Foundation, blog chính thức của OpenAI; Fortune xác minh mốc thời gian của từng bản lưu cùng những thay đổi trước sau của tỷ lệ ảo giác, FrontierMath, ExploitBench, ARC-AGI-3; trang blog của OpenAI xác nhận nguyên văn dòng miễn trừ trách nhiệm về cách tính điểm.