OpenAI nâng điểm ARC lên 38,3%

OpenAI công bố ghi chú kỹ thuật về ARC-AGI-3 vào ngày 29 tháng 7. Cùng một GPT-5.6 Sol đạt 13,3% trên tập công khai với harness chính thức; khi giữ reasoning và bật compaction trong Responses API, điểm lên 38,3%, còn output token giảm khoảng 6 lần.

Mức tăng nằm ở lớp bộ nhớ

ARC-AGI-3 đặt agent vào các trò chơi 2D theo lượt, không có hướng dẫn rõ ràng, buộc agent tự khám phá, suy ra mục tiêu và hành động hiệu quả. OpenAI cho rằng harness chính thức đã bỏ private reasoning sau mỗi hành động và dùng rolling truncation khi ngữ cảnh vượt 175.000 ký tự.

OpenAI viết: “Benchmarks rarely measure AI models in isolation.” Nói ngắn gọn, benchmark cũng đo cấu hình API, quản lý ngữ cảnh và thiết kế harness. Retained reasoning giữ lại kế hoạch trước đó; compaction giúp lưu các quan sát cũ trong nhiệm vụ dài.

Cần gắn nhãn cho các con số

13,3%, 38,3% và ước tính 48% của con người đều là RHAE trên tác vụ công khai ARC-AGI-3. Chúng không phải điểm leaderboard riêng tư hay độ chính xác thông thường. Bài báo ARC nói con người giải được 100% môi trường khi ra mắt, còn hệ thống AI frontier dưới 1%.

Với nhà phát triển, bài học rất rõ: nếu agent chạy lâu trong sản xuất có bộ nhớ và nén ngữ cảnh, bài kiểm thử cũng phải giữ các điều kiện đó. Nếu không, phép đo có thể chỉ đo sự quên cưỡng bức.

Đánh giá agent là bài toán hệ thống

Kết quả này không chứng minh GPT-5.6 Sol đã giải được ARC-AGI-3. Nó cũng không phủ nhận ARC. Nó cho thấy benchmark agent đang bao gồm cả hệ thống xung quanh: giữ bộ nhớ, phản hồi công cụ, phục hồi lỗi và nén ngữ cảnh. Các mốc cần theo dõi là quy tắc so sánh của ARC, khả năng tái lập ở lab khác và kết quả trên tập riêng tư.

Nguồn: nghiên cứu OpenAI, bài báo ARC Prize Foundation, tài liệu ARC, CocoLoop, Hugging Face gameplay logs; đối chiếu phạm vi RHAE ARC-AGI-3, GPT-5.6 Sol 13,3% với harness chính thức và 38,3% với Responses API harness, ước tính người dùng 48% trên tác vụ công khai, output token khoảng 1/6 và cửa sổ ngữ cảnh 175k.