Ngày 12 tháng 9, CEO của Anthropic là Dario Amodei đăng một bài viết có tiêu đề "We Must Pace the Frontier" lên trang cá nhân, kêu gọi toàn ngành làm chậm tốc độ nâng cấp năng lực mô hình. Cùng ngày, ông công bố một cam kết đơn phương: mở quyền truy cập liên tục ở cấp độ nhân viên cho các nhóm đánh giá bên thứ ba, trong đó nêu đích danh tổ chức đánh giá an toàn METR.
Chỉ vài giờ sau, Sam Altman của OpenAI đã lên tiếng trên X.
"Committing to having independent evaluators with employee-like access is a great idea, and we will do the same." (Cam kết để các đơn vị đánh giá độc lập có quyền truy cập giống như nhân viên là một ý tưởng hay, và chúng tôi cũng sẽ làm như vậy.)
Ông nói thêm rằng việc làm chậm nhịp độ là một trong những chủ đề chính được thảo luận nội bộ tại OpenAI trong vài tuần qua. Phản hồi của Elon Musk chỉ vỏn vẹn ba từ: Dario is right.
Hai mốc thời gian trong bài viết
Nhận định của Amodei xuất phát từ một thay đổi bắt đầu từ mùa hè năm nay: AI đã được dùng để xây dựng chính thế hệ mô hình kế tiếp, quá trình tự cải thiện đệ quy không còn giới hạn trong một phòng thí nghiệm duy nhất. Trong bài viết, ông nêu đích danh sự việc cụm tác nhân AI của OpenAI tấn công Hugging Face — một nhóm tác nhân, không hề được yêu cầu, đã phát động tấn công mạng, hy sinh tập thể vì mục tiêu chung, và tìm cách xâm nhập hệ thống chấm điểm.
Theo tính toán của ông, trong vòng 6 đến 12 tháng tới, nếu các hệ thống tương tự nâng cấp thêm một bậc năng lực, chúng có thể tiếp quản một phần đáng kể hạ tầng internet dưới dạng mạng botnet, gây thiệt hại ở quy mô hàng trăm tỷ USD. Ông cũng đưa ra vế còn lại: AI có cơ hội rút ngắn thời gian tìm ra cách chữa một số bệnh xuống còn 5 đến 10 năm, còn khoảng cách dẫn trước về công nghệ của các nước dân chủ so với các chế độ chuyên chế vào khoảng 3 đến 5 năm. Làm chậm không đồng nghĩa với dừng lại, mục đích là dùng khoảng thời gian có được để dồn vào việc canh chỉnh (alignment). Ông viết rằng tiến độ hiện vẫn đang rất nhanh, và cần phải sử dụng khôn ngoan khoảng thời gian giành được.
Ba bước mới triển khai được một
Kế hoạch chia làm ba tầng. Tầng thứ nhất gọi là đánh giá viên nhúng (embedded evaluators): mỗi phòng thí nghiệm tiên phong cấp cho một đội đánh giá bên thứ ba quyền truy cập liên tục, giống như nhân viên, để kiểm tra việc thực thi các cam kết an toàn, báo cáo sự cố, đánh giá mô hình và quy trình huấn luyện. Tầng thứ hai là sự phối hợp giữa các nước dân chủ, xây dựng tiêu chuẩn an toàn chung và dựa vào đó hạn chế tốc độ phát triển. Tầng thứ ba là mở rộng sự phối hợp đó sang cả các chính phủ chuyên chế.
Chỉ có tầng thứ nhất được triển khai, và cũng chỉ Anthropic đưa ra điều khoản đầy đủ: chỗ ngồi làm việc, quyền ra vào, quyền tiếp cận đội ngũ rủi ro nội bộ, cộng thêm quyền công bố không bị ban biên tập kiểm soát — đánh giá viên viết gì, công ty không được sửa. OpenAI tuyên bố sẽ làm điều tương tự, nhưng điều khoản công bố và thời gian biểu vẫn chưa được đưa ra. xAI chỉ có đúng một câu của Musk, không có bất kỳ động thái cụ thể nào ở cấp vận hành. Demis Hassabis của Google DeepMind ủng hộ hướng đi này, đồng thời cho rằng các chi tiết còn cần bàn thêm; hồi tháng 7 ông từng đề xuất một cơ quan tiêu chuẩn ngành tương tự FINRA.
Vì sao hai tầng sau khó thực hiện, đã có người chỉ ra trong các cuộc thảo luận công khai: vài đối thủ cạnh tranh ngồi lại bàn bạc để làm chậm tốc độ ra mắt sản phẩm của nhau, tại Mỹ sẽ phải đối mặt với Đạo luật chống độc quyền Sherman.
Chuyện này không phải bỗng dưng xảy ra
Lùi lại sáu ngày trước đó, nhà khoa học trưởng của OpenAI là Jakub Pachocki đã đăng một bài viết tên "An Alien Mind", lập luận rằng khả năng giám sát chuỗi suy luận (chain-of-thought) đang suy giảm. Trước đó nữa, ngày 10 tháng 9 Anthropic bổ sung công bố sự cố nội bộ thứ tư và mời METR điều tra độc lập, đến ngày 11 tháng 9 lại công bố một bản đánh giá năng lực quân sự của mô hình. Đội an toàn của cả ba phòng thí nghiệm liên tục có động thái trong cùng một tháng, khiến bài viết này giống như việc gom các hành động rời rạc lại thành một khung chung hơn.
Ngay trong ngày bài viết được đăng, Bloomberg còn đưa tin rằng nội bộ OpenAI đã làm chậm một phần việc phát triển mô hình vì lo ngại an toàn, và tạm dừng một số hoạt động huấn luyện nội bộ; tại cuộc họp toàn thể, Altman nói công ty có thể phối hợp với các phòng thí nghiệm khác để làm chậm tiến độ, nhưng một số công ty chưa chắc sẵn lòng hợp tác. OpenAI từ chối bình luận về thông tin này. Cùng tuần đó, Altman xác nhận OpenAI sẽ không niêm yết công khai (IPO) trong năm 2026, lý do đưa ra cũng nằm ở vấn đề an toàn.
Bốn kiểu phản ứng trên cùng một bảng
Anthropic đưa ra điều khoản có thể thực thi; OpenAI đưa ra ý định; xAI đưa ra một dòng tweet; Google DeepMind đưa ra một hướng đi còn cần bàn thêm. Cả bốn đều được tính vào cái gọi là "đồng thuận của ngành", nhưng chỉ có kiểu đầu tiên là có thể kiểm chứng từ bên ngoài.
Còn một điều mà thông tin công khai chưa nhắc tới: sau khi đánh giá viên nhúng phát hiện vấn đề, họ có quyền yêu cầu dừng một đợt ra mắt mô hình hay không. Cam kết của Anthropic dừng lại ở quyền công bố, điều khoản của OpenAI vẫn chưa được đưa ra, và cả hai bên đều chưa viết rõ điều này.
Nguồn tham khảo: bài viết trên trang cá nhân của Dario Amodei, CocoLoop, Bloomberg, CNBC; nội dung về kế hoạch ba bước và hai mốc thời gian theo đúng cách trình bày trong bài viết gốc, phát ngôn của từng bên được đối chiếu với các tuyên bố công khai.