OpenAI: 'Thực tập sinh nghiên cứu AI tự động' đạt chuẩn, agent làm bằng 3,1 ngày công

Trong báo cáo "Research acceleration: The view inside OpenAI" công bố ngày 6 tháng 9, OpenAI tuyên bố công ty đã đạt được mục tiêu nội bộ mang tên "thực tập sinh nghiên cứu tự động". Báo cáo định nghĩa đây là một hệ thống có thể hoàn thành, dưới sự hướng dẫn của con người, những tác vụ nghiên cứu được xác định rõ ràng — bao gồm cả những việc mà một nhà nghiên cứu lành nghề phải mất vài ngày mới làm xong.

Căn cứ cho tuyên bố này là một bộ dữ liệu sử dụng nội bộ. Tính đến giữa tháng 8, cứ mỗi ngày làm việc tiêu chuẩn tám giờ của một nhà nghiên cứu, các AI agent được ghi nhận thực hiện khối lượng công việc tương đương 3,1 ngày công agent. Cùng thời điểm, mức chi phí suy luận (inference) trung vị hằng ngày của các nhà nghiên cứu vượt quá 600 đô la, còn nhóm 90 phân vị cao nhất vượt quá 7.000 đô la mỗi ngày. Số nhà nghiên cứu chạy đồng thời từ bốn agent trở lên đang tăng lên. Báo cáo cũng cho biết số thí nghiệm tính trên mỗi nhà nghiên cứu đang hoạt động trong tháng 8 năm 2026 là mức cao nhất kể từ khi công ty bắt đầu thống kê chỉ số này vào tháng 1 năm 2025.

Những giới hạn mà chính báo cáo nêu ra

Tài liệu này không nói quá lời. Tỷ lệ thành công chỉ được thống kê trên những tác vụ có "ground truth" rõ ràng; những công việc nghiên cứu không có tiêu chí đúng/sai khách quan không được đưa vào. Trong nhóm tác vụ có độ phức tạp từ bốn đến tám giờ, hơn một nửa vẫn cần con người can thiệp mới hoàn tất được. Báo cáo viết thẳng rằng "The measurements are preliminary" (các phép đo vẫn còn sơ bộ), đồng thời cảnh báo rằng nhiều nút thắt tiềm ẩn có thể khiến nhịp độ nghiên cứu tổng thể không theo kịp mức tăng của từng chỉ số riêng lẻ.

Về đích đến cuối cùng, báo cáo dùng cách diễn đạt: "We do not yet know how to safely get all the way to aligned, full RSI" (chúng tôi vẫn chưa biết cách để đi trọn con đường một cách an toàn tới một hệ thống tự cải tiến đệ quy hoàn chỉnh và được căn chỉnh) — công ty thừa nhận vẫn chưa tìm ra con đường an toàn để đạt được khả năng tự cải tiến đệ quy toàn diện.

Con số 3,1 hiện chưa thể được bên ngoài xác minh độc lập. Nó phụ thuộc vào cách OpenAI tự quy đổi nội bộ khái niệm "ngày công agent", và cách quy đổi này chưa được công khai.

Lần gần nhất công ty đưa ra mốc thời gian là mười một tháng trước

Hai mốc thời gian này không phải mới được đưa ra. Trong một buổi livestream hồi tháng 10 năm 2025, Sam Altman từng nói:

"we think it is plausible that by September of next year, we have an intern-level AI research assistant and that by March 2028, we have a legitimate AI researcher."

Chúng tôi cho rằng có khả năng đến tháng 9 năm sau, chúng tôi sẽ có một trợ lý nghiên cứu AI ở trình độ thực tập sinh, và đến tháng 3 năm 2028, chúng tôi sẽ có một nhà nghiên cứu AI thực thụ.

Theo cách tính của chính OpenAI, mốc đầu tiên đã được hoàn thành đúng tháng như dự kiến. Mốc thứ hai vẫn được ấn định vào tháng 3 năm 2028, và báo cáo mô tả nó là một nhà nghiên cứu AI tự động có thể, dưới sự giám sát của con người, thúc đẩy nghiên cứu về deep learning và alignment, hỗ trợ cải tiến lặp đi lặp lại — chứ không chỉ là một trợ lý chỉ nhận được các tác vụ hẹp.

Trên chặng đường này còn có hai sự cố không mấy suôn sẻ được ghi trong cùng báo cáo. Ngày 20 tháng 7, dịch vụ container của công ty đã phải tạm ngừng sau một sự cố bảo mật. Ngày 7 tháng 8, hệ thống Astra bị gắn cờ là đã sở hữu năng lực an ninh mạng ở mức trọng yếu. Chính bộ công cụ nội bộ giúp đẩy nhanh thông lượng nghiên cứu cũng đang tự tạo ra những vấn đề bảo mật cần xử lý.

Hóa đơn cũng tăng theo

Nhóm số liệu về chi phí suy luận dễ kiểm chứng xu hướng hơn con số 3,1. Mức trung vị 600 đô la mỗi ngày cho mỗi nhà nghiên cứu có nghĩa là một đội nghiên cứu quy mô trăm người, chỉ riêng chi phí gọi agent, đã tiêu tốn mức tính toán vào khoảng 60 triệu đô la mỗi năm — đây là ước tính thô dựa trên 250 ngày làm việc, chưa tính chi phí huấn luyện. Với nhóm 90 phân vị chi 7.000 đô la một ngày, một cá nhân trong một năm có thể tiêu gần 2 triệu đô la.

Khoản chi này khác về bản chất so với chi phí tính toán cho huấn luyện. Huấn luyện là khoản đầu tư một lần, mô hình chạy ra có thể dùng lại nhiều lần; còn việc nhà nghiên cứu dùng agent để chạy thí nghiệm là tiêu hao thuần túy, dùng xong là hết, và càng dùng quen tay thì càng tốn. Quan sát trong báo cáo rằng "số người chạy đồng thời từ bốn agent trở lên đang tăng lên" chính là biểu hiện của độ dốc đường cong chi phí này.

Đối với người quan sát bên ngoài, tháng 3 năm 2028 là mốc tiếp theo có thể đối chiếu. Trước thời điểm đó, tài liệu công khai duy nhất có thể dùng để đối chứng chéo vẫn chỉ là báo cáo do chính OpenAI công bố.

Nguồn tham khảo: Báo cáo tăng tốc nghiên cứu chính thức của OpenAI, CocoLoop, unite.ai; trang báo cáo của OpenAI đã được đối chiếu để xác minh tỷ lệ 3,1 ngày công agent, mức chi phí suy luận trung vị và phân vị 90, tỷ lệ can thiệp thủ công trong nhóm tác vụ bốn đến tám giờ, cũng như nguyên văn phát biểu của Altman về hai mốc thời gian.