Ngày 21/8, Anthropic công bố cùng lúc bốn việc: Claude Mythos 5 được tích hợp vào Claude Security và sẽ sớm được nhúng vào các sản phẩm an ninh mạng của đối tác; đồng thời công ty dành 35 triệu USD tín dụng cho bảo mật phần mềm mã nguồn mở, và mở rộng phạm vi của Cyber Verification Program.
Câu chuyện phải lần về tháng 4. Dòng Mythos ngay từ đầu không bán ra công khai mà đi theo Project Glasswing: một nhóm tổ chức đang giữ các phần mềm trọng yếu được dùng thử trước, cho bên phòng thủ một khoảng thời gian để tìm và vá lỗ hổng trước khi một mô hình có năng lực tương đương lan ra thị trường. Theo các báo cáo công khai, danh sách này đã mở rộng từ vài chục tổ chức ban đầu lên 150 tổ chức tại 15 quốc gia vào tháng 6. Theo cách nói của chính Anthropic, mục tiêu luôn là đưa năng lực phòng thủ ngang tầm Mythos đến càng nhiều người càng tốt, miễn là vẫn an toàn.
Cho kết quả, không cho mô hình
Anthropic nói thẳng về mức độ rủi ro:
"The riskiest behavior occurs when a user has direct access to a model, where a malicious actor can try to steer it toward harmful uses."
Tình huống rủi ro nhất là khi người dùng truy cập trực tiếp vào mô hình, lúc đó kẻ xấu có thể tìm cách lái nó sang mục đích gây hại.
Vì vậy đợt mở này diễn ra ở lớp sản phẩm. Đối tác tích hợp Mythos 5 vào công cụ phân loại cảnh báo, ứng phó sự cố, tình báo mối đe dọa, vá lỗ hổng của chính họ; người dùng cuối chỉ thấy một giao diện được thiết kế riêng cho một tác vụ cụ thể, nhận về một danh sách bản vá hoặc một cảnh báo, không có ô nhập liệu nào để lái mô hình sang viết mã khai thác. Anthropic và các đối tác vẫn phải tự xây cơ chế chống lạm dụng, xác nhận mô hình không vượt ra ngoài phạm vi đã định. Các hãng bảo mật muốn kết nối giờ có thể đăng ký. Sự sắp xếp này đổi câu hỏi "ai được dùng Mythos" thành "ai được nhận kết quả từ Mythos", và bề mặt rủi ro của hai câu hỏi đó hoàn toàn khác nhau.
Bản doanh nghiệp quét được thẳng vào kho mã
Claude Security là phần cụ thể hơn. Từ hôm nay, tính năng quét của nó chuyển sang chạy bằng Mythos 5, dành cho khách hàng Claude Enterprise, hiện đang ở giai đoạn thử nghiệm công khai. Quản trị viên bật công tắc ở phần quản trị, người dùng vào claude.ai/security chọn một kho mã, mỗi kết quả quét trả về kèm phân loại CWE, mức độ tin cậy, xếp hạng mức độ nghiêm trọng và một gợi ý sửa lỗi. Việc sửa mã thực tế được chuyển sang bản Claude Code trên web, dùng đúng quyền mô hình mà tổ chức đã có sẵn - lần quét này không để quyền truy cập Mythos rò rỉ sang các cổng khác. Bản vá vẫn phải qua phê duyệt của con người mới được áp dụng.
Cách tính phí đáng chú ý riêng: quét bằng Mythos được tính vào lượng token thông thường trong gói đang dùng, không có mục thu thêm riêng. Một mô hình mà bốn tháng trước chỉ mở cho vài tổ chức hạ tầng trọng yếu qua một chương trình được kiểm soát chặt, nay nằm trong gói doanh nghiệp mà không tính thêm phí.
35 triệu USD, nhưng dưới dạng tín dụng
Defender Advantage Fund (0xDAF) đưa ra 35 triệu USD tín dụng Claude, cấp cho các tổ chức hỗ trợ bảo mật cho người duy trì mã nguồn mở. Ba hướng: vá các lỗ hổng đang bị khai thác trong những dự án được dùng rộng rãi; tự động hóa quy trình quét và vá để dự án khác có thể áp dụng lại; giúp dự án cải tổ bảo mật sâu hơn để vô hiệu hóa cả một nhóm kiểu tấn công. Một số khoản tài trợ lớn thí điểm sẽ được cấp trước, danh sách công bố sau vài tuần.
So với con số trước đó: ở giai đoạn Glasswing, Anthropic từng tặng trực tiếp 4 triệu USD cho các tổ chức bảo mật mã nguồn mở, cộng thêm một ít tín dụng cho các quỹ. Lần này con số lớn gấp gần chín lần, nhưng lại ở dạng tín dụng, chỉ dùng được để chạy Claude. Với các quỹ mã nguồn mở nhận được, số tiền này không mua được nhân sự, chỉ mua được năng lực tính toán; với Anthropic, chi phí rơi vào phần suy luận biên, không thể hiện thành dòng tiền chi ra. Tính sơ qua thì hai bên không thực sự cân bằng, nhưng cái mà các dự án mã nguồn mở thiếu cũng không chỉ là tiền - nhiều thư viện bị bỏ không bảo trì lâu năm đang mắc kẹt chính vì không ai có đủ thời gian đọc hết vài chục nghìn dòng mã.
Nửa còn lại của việc nới lỏng
Cyber Verification Program đã đang chạy, giảm mức độ chặn trên Opus và Sonnet cho các bên phòng thủ đã qua kiểm duyệt, để công việc bảo mật chính đáng đỡ bị chặn nhầm. Vài tuần tới phạm vi này sẽ mở rộng sang thêm nhiều năng lực lưỡng dụng, quyền truy cập ngang tầm Mythos sẽ theo sau; các hành động phòng thủ như phân loại và xác minh lỗ hổng sẽ được mở cho các mô hình cấp Mythos. Glasswing không dừng lại, vẫn tiếp tục hợp tác với chính phủ Mỹ, dành cho các tổ chức hạ tầng trọng yếu đáp ứng yêu cầu kiểm soát an ninh nghiêm ngặt.
Ghép bốn việc lại, Anthropic đang tự giải một bài toán do chính mình đặt ra. Bước đi của Claude Fable 5 là mở mô hình ra và tắt năng lực mạng lưỡng dụng; bước này là tách năng lực ra khỏi mô hình và phát theo kết quả. Bộ phân loại và lớp bảo vệ làm tốt đến đâu sẽ quyết định con đường này đi được xa đến đâu. Trong sự cố tự công bố hồi cuối tháng 7, Mythos 5 - ở nơi nó tưởng là môi trường mô phỏng - đã đẩy một gói Python độc hại lên PyPI thật, gói này tồn tại trực tuyến khoảng một giờ, bị 15 hệ thống thật tải về và chạy. Ranh giới được vẽ ở đâu, và mô hình nghĩ ranh giới nằm ở đâu, vẫn còn một khoảng cách.
Nguồn tham khảo: blog chính thức của Anthropic, CocoLoop, tài liệu sản phẩm Claude Security; số tiền tín dụng của quỹ, cách tính phí và phạm vi điều chỉnh của Cyber Verification Program đã được đối chiếu theo nội dung công bố chính thức.