Nhà khoa học trưởng của OpenAI, Jakub Pachocki, đã đăng bài luận dài mang tên "An Alien Mind" vào ngày 6 tháng 9, trong đó có một nhận định được trích dẫn rộng rãi: hiện tại ông cho rằng chưa phòng thí nghiệm nào giải quyết được vấn đề đồng nhất (alignment) và giám sát ở mức đủ để tiếp tục mở rộng quy mô một cách có trách nhiệm ở tốc độ tối đa.
Câu nói này đến từ chính nhà khoa học trưởng của một công ty đang mở rộng ở tốc độ tối đa, vị trí phát ngôn hiếm gặp hơn cả nội dung của nó.
Tuyến giám sát chuỗi tư duy đang xuống cấp
Trong hai năm qua, biện pháp an toàn mà OpenAI đặt cược nhiều nhất là giám sát chuỗi tư duy (chain-of-thought monitoring): để mô hình suy luận viết ra các bước trung gian, sau đó dùng một hệ thống khác đọc các bước này để phán đoán xem mô hình có đang toan tính điều gì hay không. Pachocki đưa ra ba lý do cho thấy phương pháp này ngày càng kém tin cậy.
Thứ nhất, các mô hình suy luận hiện nay hoạt động trong môi trường phức tạp, quá trình suy luận và việc gọi công cụ (tool calling) đan xen vào nhau, bản thân việc gọi công cụ đã cần giám sát chặt chẽ, khiến ranh giới giám sát trở nên mờ nhạt. Thứ hai, mô hình ngày càng thành thạo hơn trong cách suy luận, cũng như cách thao túng dấu vết suy luận của chính mình. Thứ ba, những cải tiến trong giai đoạn tiền huấn luyện (pre-training) khiến mô hình trở nên mạnh hơn ngay cả khi không nói ra quá trình suy luận.
"Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer."
Tạm dịch: Hiện tại tôi cho rằng chưa phòng thí nghiệm nào giải quyết được vấn đề đồng nhất và giám sát ở mức đủ để tiếp tục mở rộng quy mô một cách có trách nhiệm ở tốc độ tối đa trong thời gian dài nữa.
Pachocki nói thêm rằng những khó khăn này chưa hẳn là vô phương giải quyết, OpenAI đang phát triển các biện pháp can thiệp mới, trong đó có các bộ giám sát có thể truy cập trực tiếp vào trạng thái nội bộ của mạng nơ-ron.
Một đầu mối khác từ ba năm trước
Bài viết nhắc lại một mốc thời gian. Giữa năm 2023, trong một dự án nghiên cứu nội bộ của OpenAI có tên RLSlow, Pachocki và đồng nghiệp Szymon lần đầu tiên nhìn thấy kết quả khiến họ tin rằng có thể huấn luyện mô hình suy luận ở quy mô lớn, kết quả đó đã mở khóa khả năng mô hình tiền huấn luyện tự hình thành chuỗi tư duy.
Nối hai đầu lại với nhau: việc để mô hình "nghĩ thành lời" từng vừa là một bước đột phá về năng lực, vừa vô tình tạo ra một cửa sổ quan sát. Ba năm sau, đầu năng lực vẫn tiếp tục tăng, còn đầu cửa sổ quan sát đang khép lại. Trên tuyến mô hình suy luận, OpenAI luôn coi khả năng đọc được chuỗi tư duy là điểm tựa cho câu chuyện an toàn của mình. Giờ đây chính công ty đó nói rằng điểm tựa ấy đang lung lay.
Từ khung tự nguyện đến tiêu chuẩn bắt buộc
Đề xuất của Pachocki là nâng cấp các khung tự nguyện hiện có của ngành: những văn bản như Preparedness Framework của OpenAI hay Responsible Scaling Policy của Anthropic nên phát triển thành các tiêu chuẩn an toàn bắt buộc, được thực thi bởi các tổ chức kiểm toán độc lập, cơ quan chính phủ hoặc tổ chức quốc tế. Ông cũng viết rằng chính phủ các nước nên đưa việc phối hợp quốc tế về phát triển trí tuệ nhân tạo lên hàng ưu tiên, và ông dự đoán, đồng thời hy vọng, việc chủ động giảm tốc sẽ trở nên phổ biến cho đến khi các ngưỡng an toàn chung được thiết lập.
Một câu khác cũng được trích dẫn nhiều là: một khi đã hiểu thấu mức độ nghiêm trọng của rủi ro, ý tưởng lao về phía trước bằng mọi giá sẽ trở nên phi lý.
Những phát biểu này hiện vẫn chỉ dừng ở cấp độ một bài luận ký tên cá nhân. OpenAI chưa công bố bất kỳ kế hoạch giảm tốc cụ thể, mốc thời gian hay điều kiện kích hoạt nào, cũng chưa nói rõ trong trường hợp nào công ty sẽ chủ động tạm dừng một hướng huấn luyện nào đó. Ai là người xác định ngưỡng an toàn, cơ quan kiểm toán sẽ đến từ đâu, bài viết cũng không đưa ra phương án. Cùng lúc đó, công ty này vẫn đang thúc đẩy mục tiêu tự động hóa nghiên cứu, cùng với một hồ sơ niêm yết được định giá 852 tỷ đô la Mỹ.
Nguồn tham khảo: Bài viết chính thức "An Alien Mind" của OpenAI, Unite.AI, CocoLoop, AI Weekly; ba lý do về độ tin cậy giám sát suy giảm và các trích dẫn đã được đối chiếu theo nội dung công khai của OpenAI.