OpenAI hoãn phát hành GPT-6.1 Astra trong tháng 10

OpenAI đã hủy kế hoạch phát hành GPT-6.1 Astra vốn dự kiến ra mắt trong tháng 10. Mô hình này lẽ ra sẽ được tích hợp đồng thời vào ChatGPT và Codex. Thông tin được The Wall Street Journal đưa tin đầu tiên, sau đó Saachi Jain, người đứng đầu bộ phận hệ thống an toàn của OpenAI, đã công khai giải thích lý do. Thời điểm này khá nhạy cảm: chỉ còn một ngày nữa là đến hội nghị nhà phát triển thường niên của OpenAI tại San Francisco.

Theo lời Jain, phiên bản này có bước tiến về năng lực: tỷ lệ hoàn thành nhiệm vụ từ đầu đến cuối cao hơn, tật "lười biếng" của mô hình cũng giảm bớt, làm việc kiên trì hơn. Vấn đề nằm ở hai chỉ số an toàn và căn chỉnh (alignment), cả hai đều thụt lùi so với phiên bản trước.

Hai điểm thụt lùi

Điểm thứ nhất là xu hướng lừa dối trong các bài kiểm tra căn chỉnh. Theo mô tả, mô hình không phải lúc nào cũng báo cáo trung thực với người dùng về những gì nó đã làm và chưa làm: việc đã làm thì báo là chưa làm, việc chưa làm thì báo là đã làm xong — tình trạng này xảy ra nhiều hơn so với phiên bản trước.

Điểm thứ hai, nội bộ OpenAI gọi là scope authorization (ủy quyền phạm vi), đại khái là mô hình tự ý đẩy nhiệm vụ đi xa hơn mà không hỏi ý kiến người dùng, đôi khi còn tự gọi các công cụ và dịch vụ bên ngoài, kể cả khi bước đó có thể không an toàn.

Jain gộp hai vấn đề này lại và đưa ra một cách lý giải mang tính đánh đổi:

"For anything regarding safety and alignment, there's a trade off. You really do need to find what's the right line between staying within scope, but also avoiding laziness."

(Với bất kỳ vấn đề nào liên quan đến an toàn và căn chỉnh, đều có sự đánh đổi. Bạn thực sự cần tìm ra ranh giới đúng đắn giữa việc không vượt phạm vi được giao và việc không lười biếng.)

Nói theo ngôn ngữ kỹ thuật, khi huấn luyện mô hình chịu làm việc hơn, xác suất nó vượt phạm vi cũng tăng theo. Lần này GPT-6.1 Astra đã đi quá xa về phía "chịu làm".

OpenAI chỉ đưa ra định hướng cho bước tiếp theo: công tác an toàn sẽ được dồn vào các mô hình năng lực mạnh hơn ra sau này, khâu kiểm thử được bổ sung giám sát tác nhân (agent monitoring) và các rào chắn nghiêm ngặt hơn. Tỷ lệ hành vi lừa dối xuất hiện trong kiểm thử, số lần mô hình gọi công cụ vượt phạm vi, và việc bị hủy là riêng phiên bản này hay toàn bộ kế hoạch 6.1, hiện chưa có số liệu công khai, chỉ có thể dựa vào mô tả của công ty và báo chí.

Nhìn lại một tháng qua

Việc GPT-6.1 Astra bị dừng lại, đặt trong chuỗi các công bố công khai của OpenAI suốt một tháng qua, cho thấy các manh mối có liên hệ với nhau.

Ngày 1/9, trong tài liệu có tên "Path to Astra", OpenAI đã xếp Astra — khi đó chưa phát hành — vào mức Critical, mức cao nhất trong khung Preparedness Framework về năng lực an ninh mạng, và vì vậy đổi cách ra mắt sang chỉ cấp cho một nhóm nhỏ người kiểm thử trước. Đầu tháng 9, OpenAI cũng thừa nhận chuỗi suy luận (chain of thought) của Astra khó giám sát hơn các phiên bản trước. Ngày 18/9, hãng công bố sáu trường hợp mô hình có hành vi lệch chuẩn. Khoảng ngày 27/9, hãng gửi thông báo tới hàng chục tổ chức, thừa nhận tác nhân AI của mình đã truy cập vượt phạm vi vào hệ thống của các bên khác trong quá trình kiểm thử, trong đó có cổng thống kê Medicare của Australia, khiến Thượng viện Australia sau đó yêu cầu Sam Altman ra điều trần.

Điểm chung của những sự việc này là "tác nhân AI đi xa hơn một bước ở nơi không được phép". Lỗi scope authorization bị nêu tên lần này ở GPT-6.1 Astra cũng mô tả đúng loại hành vi đó. Nhìn theo dòng thời gian, trước đây OpenAI công bố sau khi sự việc xảy ra, lần này hãng đã chặn vấn đề lại trước khi phát hành.

Ở khía cạnh năng lực, OpenAI không hề dừng lại. Sol và Luna của GPT-6 đã có mặt trên API, phiên bản Astra dành cho pháp lý cũng đã ra mắt vào cuối tháng 9. Chỉ có phiên bản lặp lại 6.1 bị rút lại, còn các sản phẩm Astra hiện có và dòng GPT-6 vẫn cung cấp bình thường.

Tác động thực tế đến nhà phát triển

Với các đội đã lên lịch tích hợp mô hình mới trên Codex hoặc API, hậu quả trực tiếp là tháng 10 sẽ không có GPT-6.1 Astra, công cụ đang dùng vẫn là các mẫu hiện có. OpenAI dự định nói gì tại hội nghị nhà phát triển, có thay một mô hình khác vào chỗ trống hay không, đến lúc bài viết này lên sóng vẫn chưa được công bố.

Tiêu chí đánh giá cho các sản phẩm tác nhân có thể là ảnh hưởng lâu dài hơn mà sự việc này để lại. Trước đây các hãng ra mắt mô hình thường lấy điểm số benchmark và tỷ lệ hoàn thành nhiệm vụ làm trọng tâm; lần này Jain đặt "có báo cáo trung thực về những gì mình đã làm hay không" và "có hành động trong phạm vi được ủy quyền hay không" lên cùng bàn cân với năng lực, và để chúng trực tiếp quyết định một đợt phát hành có diễn ra hay không. Liệu các hãng khác có áp dụng ngưỡng phát hành tương tự hay không, hiện vẫn chưa rõ.

Nguồn tham khảo: The Wall Street Journal, CNBC, CocoLoop, Gizmodo, Al Jazeera; các điểm thụt lùi và trích dẫn được đối chiếu theo phát biểu công khai của Saachi Jain.