Bio Bug Bounty của OpenAI hôm nay chính thức bước vào giai đoạn thử nghiệm.
Luật chơi rất rõ: tìm một prompt khiến GPT-5.5 trong Codex Desktop trả lời trọn vẹn cả 5 câu hỏi về an toàn sinh học, mà không kích hoạt bất kỳ cơ chế rà soát nào. Người đầu tiên làm được sẽ nhận 25.000 USD.
Nghe giống một cuộc CTF. Nhưng trên thực tế, yêu cầu nghiêm ngặt hơn nhiều.
Điểm lạ của chương trình treo thưởng này
Cấu trúc được giới hạn rất chặt:
- Tiền thưởng: 25.000 USD cho nhà nghiên cứu đầu tiên hoàn thành cả 5 câu hỏi; các phát hiện chưa trọn vẹn nhưng có giá trị có thể được thưởng theo đánh giá riêng.
- Môi trường: chỉ tính thử nghiệm GPT-5.5 trong Codex Desktop. Các kịch bản khác không hợp lệ.
- Thời gian: nhận đăng ký từ 23/4 đến 22/6, thử nghiệm từ 28/4 đến 27/7.
- Bảo mật: người tham gia phải ký NDA; dữ liệu thử nghiệm, prompt và kết quả phát hiện đều không được công khai.
Từ khóa quan trọng là "universal jailbreak". OpenAI không hỏi liệu một câu cụ thể có thể bị vượt qua hay không. Họ muốn một prompt duy nhất giải được cả 5 câu hỏi.
Điều này làm bài toán red team khó hơn hẳn. Phần lớn thử nghiệm AI red team tối ưu từng trường hợp riêng lẻ. Lần này, OpenAI yêu cầu chứng minh rằng một prompt đơn lẻ có thể đưa GPT-5.5 vượt qua 5 lớp rào an toàn sinh học, trong khi hệ thống rà soát không phát hiện gì trong toàn bộ quá trình.
Vì sao là Codex Desktop
Đây là chi tiết khá ngược trực giác.
GPT-5.5 có nhiều cửa vào: web, API, Codex CLI và Codex Desktop. OpenAI lại chỉ cho thử trong Codex Desktop.
Có hai cách giải thích hợp lý. Thứ nhất, Codex Desktop là môi trường dành cho lập trình viên, mang tính tác nhân, giống một nhân viên vô hình. Ranh giới sandbox, quyền truy cập và cách quản lý ngữ cảnh của nó khác ChatGPT bản web. Nếu jailbreak liên quan đến an toàn sinh học thành công trong bối cảnh này, điều đó cho thấy ranh giới an toàn của triển khai agent có vấn đề, đúng vào mối quan tâm lớn của OpenAI.
Thứ hai, giới hạn này giúp kiểm soát biến số. Khi bề mặt thử nghiệm được cố định, báo cáo red team dễ so sánh hơn và giảm nhiễu do khác biệt prompt template giữa các kênh.
Nhưng giới hạn ấy cũng có nghĩa rõ ràng: bề mặt tấn công trên ChatGPT web, di động hay gọi API trực tiếp không thuộc phạm vi treo thưởng lần này. 25.000 USD mua một bằng chứng rất cụ thể về một ranh giới an toàn, không phải sự chắc chắn rằng GPT-5.5 vững ở mọi nơi.
Năm câu hỏi là gì?
OpenAI không công bố. NDA cũng cấm người tham gia tiết lộ đề bài.
Có thể suy đoán rằng 5 câu hỏi này do chuyên gia chọn lọc, và nếu được trả lời đầy đủ có thể thúc đẩy nghiên cứu sinh học gây hại. Anthropic trong năm qua đã thử các hướng tương tự với Constitutional Classifiers, nhưng cách làm của OpenAI lần này mạnh tay hơn: ghép trực tiếp red team với cơ chế bug bounty.
Cũng đáng so sánh với Mythos Preview trước đây của Anthropic, nơi 40 công ty được mời tham gia tìm lỗ hổng. Bio Bounty của OpenAI là mô hình mời kèm đăng ký, nhắm vào nhân sự red team chuyên sâu và tập trung vào một hạng mục cực đoan duy nhất: an toàn sinh học.
Hai cách nghĩ khác nhau: Anthropic kiểm tra hệ sinh thái doanh nghiệp, còn OpenAI đẩy giới hạn của một kịch bản cô lập.
Tín hiệu đáng chú ý nhất
Vấn đề không phải 25.000 USD có đủ hấp dẫn các red team hàng đầu hay không. Trong thị trường red team AI, con số này thật ra không lớn. VRP của Google hay Bug Bounty của Meta có thể lên tới sáu chữ số.
Tín hiệu thật sự nằm ở thời gian thử nghiệm kéo dài ba tháng.
Nếu có người lấy được tiền thưởng trong ba tháng, điều đó cho thấy rào an toàn sinh học của GPT-5.5 có lỗ hổng mang tính hệ thống. OpenAI sẽ phải vá nó trong bản cập nhật an toàn GPT-5.5 Pro tiếp theo.
Nếu không ai thành công, OpenAI sẽ có một hồ sơ công khai và đáng tin cậy rằng một thử thách red team đã không phá được hệ thống. Nó hữu ích hơn nhiều so với các báo cáo an toàn tự khen.
Đây là lần đầu tiên OpenAI dùng cơ chế bounty để công khai kiểm tra một lớp guardrail đơn lẻ của mô hình. Các Bug Bounty trước đây bao phủ vấn đề an toàn và quyền riêng tư rộng hơn. Lần này, trọng tâm được khóa thẳng vào an toàn sinh học.
Những người theo dõi ngành đều hiểu lý do. An toàn sinh học AI là ưu tiên quản lý trong năm 2026. National Policy Framework của Nhà Trắng và AI Act của EU đều xếp rủi ro sinh học vào nhóm đáng quan ngại cao nhất.
OpenAI đang tích lũy dữ liệu trước khi các chi tiết quản lý được chốt lại.
Ba tháng tới sẽ rất đáng theo dõi.
Nguồn: GPT-5.5 Bio Bug Bounty (OpenAI chính thức); CocoLoop; GPT-5.5 Bio Bug Bounty Program Aims to Improve AI Safety and Performance (GBHackers); OpenAI offers $25,000 reward to hack GPT-5.5 safety controls (VARindia)