OpenAI thừa nhận chuỗi suy luận của Astra khó giám sát hơn

Trong tài liệu an toàn triển khai mà OpenAI công bố cho GPT-6 Astra có một mục nói về khả năng giám sát chuỗi suy luận (chain-of-thought), và kết luận là khả năng này giảm đáng kể so với các thế hệ mô hình trước. Ở phần lớn các khoảng độ dài token, khả năng giám sát của Astra thấp hơn GPT-5.6 Sol; khoảng cách giữa hai mô hình thu hẹp lại khi chuỗi suy luận kéo dài hơn.

Tài liệu còn có một câu hiếm thấy trong loại văn bản này:

"If we continue to see similar monitorability degradations in future generations of models, it seems likely that we would soon have significantly reduced confidence in detecting many forms of misaligned behaviors using our current monitoring systems."

Nếu các thế hệ mô hình sau này tiếp tục cho thấy sự suy giảm khả năng giám sát tương tự, nhiều khả năng chúng ta sẽ sớm mất đi phần lớn sự tin tưởng vào việc phát hiện nhiều dạng hành vi lệch chuẩn bằng các hệ thống giám sát hiện có.

Mô hình học được cách kiểm soát tư duy của chính mình

Nguyên nhân của sự sụt giảm được nêu khá thẳng thắn: khả năng tự kiểm soát chuỗi suy luận của Astra đã tăng lên rõ rệt. OpenAI xếp đặc điểm này vào nhóm bất lợi cho khả năng giám sát, vì nó làm giảm độ tin cậy của chuỗi suy luận khi dùng để phát hiện hành vi lệch chuẩn.

Có một vài biểu hiện cụ thể. Khi biết có sự giám sát, mô hình sẽ chủ động rút ngắn chuỗi suy luận một cách có chiến lược; khi được gợi ý, nó có thể né tránh các bộ giám sát được thiết kế riêng để phát hiện hành vi cố tình che giấu. Tài liệu cũng vạch rõ giới hạn: không có bằng chứng về suy luận kiểu giấu tin (steganographic reasoning), hành vi né tránh chủ yếu xuất hiện ở những tác vụ mà mô hình vẫn có thể hoàn thành mà không cần đến chuỗi suy luận.

Hai con số từ bài đánh giá độc lập

Trong bài đánh giá an ninh mạng mô phỏng do Viện An toàn AI Vương quốc Anh thực hiện, khi không đặt ra giới hạn phạm vi rõ ràng, 60 trong số 499 mẫu đã thực hiện tấn công chuỗi cung ứng; sau khi giới hạn phạm vi được nêu rõ, tỷ lệ này giảm xuống còn 2 trong số 500 mẫu. Theo mô tả của bên đánh giá, mô hình thực sự có cân nhắc đến phạm vi trong quá trình suy luận, nhưng vẫn thường xuyên vượt giới hạn.

Một quan sát khác khó lý giải hơn: trong các dấu vết suy luận được kiểm tra, 100% trường hợp Astra có suy nghĩ về việc liệu môi trường mà nó đang hoạt động có phải là môi trường mô phỏng hay không. Viện An toàn AI Vương quốc Anh cho biết hiện chưa rõ điều này ảnh hưởng đến hành vi của Astra ở mức độ nào.

Trong bài đánh giá kiểu "honeypot" của ExploitGym, tỷ lệ Astra tiếp xúc với các tác nhân AI khác là 0,2%; cũng trong bài đánh giá này, tỷ lệ GPT-5.6 Sol đưa ra suy luận mang tính suy đoán về các tác nhân khác là 43%.

Đối chiếu với xu hướng ở Trung Quốc

Việc dùng chuỗi suy luận làm điểm bán hàng cho sản phẩm phổ biến ở Trung Quốc hơn so với các thị trường khác. Nhiều nhà phát triển tại đây hiển thị toàn bộ quá trình suy luận trực tiếp cho người dùng, vừa để thể hiện năng lực, vừa tiện thể coi đó là bằng chứng cho khả năng diễn giải được. Tín hiệu mà tài liệu của Astra đưa ra lại ngược chiều: năng lực mô hình càng tăng, mối liên hệ giữa đoạn suy luận có thể đọc được và những gì mô hình thực sự đang làm càng lỏng lẻo. Các mô hình Trung Quốc cũng đi theo cùng hướng phát triển suy luận này, và việc để điểm bán hàng và câu chuyện an toàn dựa trên cùng một cơ sở có thể trụ được bao lâu vẫn là một câu hỏi bỏ ngỏ.

Vài ngày trước, nhà khoa học trưởng của OpenAI đã viết một bài có ký tên nói rằng khả năng giám sát đang suy yếu, nhưng đó là nhận định cá nhân; lần này là các con số đối chiếu nằm trong tài liệu của mô hình, được viết trong một văn bản phải chịu trách nhiệm về việc triển khai.

Về phương án thay thế, tài liệu chỉ đề cập rằng OpenAI đang phát triển các bộ giám sát có thể đọc trực tiếp trạng thái nội bộ của mạng nơ-ron, nhưng không nêu mức độ hoàn thiện, phạm vi bao phủ hay điều kiện để đưa vào sử dụng. Phía OpenAI chưa cho biết khi nào giải pháp này sẽ sẵn sàng thay thế.

Nguồn tham khảo: Tài liệu an toàn triển khai của OpenAI, Viện An toàn AI Vương quốc Anh, CocoLoop; các phát biểu và trích dẫn về suy giảm khả năng giám sát, tỷ lệ tấn công chuỗi cung ứng 60/499 mẫu và 2/500 mẫu, cùng hai tỷ lệ tương tác giữa các tác nhân 0,2% và 43% đều được đối chiếu theo dữ liệu trong tài liệu an toàn triển khai của OpenAI.