Anthropic tạo ra AI có thể khai quật lỗ hổng 27 năm tuổi

Anthropic hôm qua (7/4) đã làm một điều khác thường: phát hành một mô hình mới, nhưng không cho công chúng sử dụng.

Mô hình này có tên là Claude Mythos. Đánh giá nội bộ của Anthropic cho biết nó vượt trội hơn bất kỳ mô hình AI nào khác về năng lực an ninh mạng. Và họ quyết định không công khai, chỉ cho một nhóm nhỏ đối tác được chọn dùng thử.

Dự án này có tên là Project Glasswing.

Ai được sử dụng thứ này?

Danh sách rất ấn tượng: AWS, Apple, Nvidia, Google, Microsoft, Cisco, CrowdStrike, JPMorgan Chase… khoảng 10 gã khổng lồ công nghệ, cùng với 40 tổ chức khác chịu trách nhiệm duy trì hạ tầng quan trọng.

Tổng cộng khoảng 50 tổ chức. Internet mà hàng tỷ người trên thế giới sử dụng sẽ phụ thuộc vào 50 tổ chức này để vá lỗi bằng Mythos.

Anthropic cũng tặng kèm 100 triệu USD hạn mức sử dụng mô hình cho các đối tác này, đồng thời quyên góp trực tiếp 4 triệu USD cho cộng đồng bảo mật mã nguồn mở.

Mythos thực sự có thể tìm ra lỗ hổng gì?

Trong vài tuần qua, Anthropic đã dùng Mythos Preview để quét:

  • Hàng nghìn lỗ hổng zero-day, bao phủ mọi hệ điều hành chính và mọi trình duyệt chính
  • Một lỗ hổng tồn tại 27 năm trong OpenBSD có thể gây ra sự cố hệ thống từ xa
  • Một khiếm khuyết 16 năm tuổi trong FFmpeg, trước đó đã trải qua hàng triệu bài kiểm tra tự động mà không bị phát hiện
  • Nhiều lỗ hổng Linux kernel cho phép leo thang đặc quyền

27 năm. Không phải đang tìm lỗi, mà đang khai quật.

Lỗ hổng FFmpeg càng cho thấy rõ vấn đề: hàng triệu lần quét tự động không bắt được, một AI phát hiện ra trong vài tuần. Các công cụ bảo mật truyền thống nên lo lắng về vị trí của mình.

Tại sao không dám công khai?

Anthropic đã cảnh báo riêng với giới chức cấp cao: Mythos khiến các cuộc tấn công mạng quy mô lớn do AI điều khiển có khả năng xảy ra cao hơn đáng kể trong năm nay.

Cách đây một tháng, một bản thảo nội bộ bị rò rỉ đã viết: Mythos hiện vượt trội hơn bất kỳ mô hình AI nào khác về năng lực an ninh mạng. Câu nói này giờ đây không phải là khoe khoang, mà là bày tỏ mối lo ngại nghiêm túc.

Phòng thủ và tấn công sử dụng cùng một năng lực. Mythos có thể giúp bạn tìm lỗ hổng, sửa lỗ hổng, nhưng cũng có thể giúp tin tặc tìm lỗ hổng và xâm nhập. Cách tiếp cận của Anthropic là: tạo lợi thế đi trước cho phe phòng thủ – để các công ty lớn và người duy trì hạ tầng quan trọng vá lỗ trước khi kẻ tấn công kịp hành động.

Chiến lược này có vấn đề không?

Đây là một canh bạc khá tinh tế.

Điểm thuyết phục: Nếu Mythos thực sự có thể khai thác hàng loạt những lỗ hổng đã tồn tại hàng chục năm mà chưa được sửa, thì về mặt phòng thủ, đây thực sự là một bước đột phá. Các công cụ bảo mật hiện tại rõ ràng không làm được, nếu không thì lỗ hổng 27 năm tuổi của OpenBSD đã bị phát hiện từ lâu.

Nhưng mô hình giới hạn cho 50 tổ chức có thể duy trì được bao lâu? Liệu người trong các đối tác có thể làm rò rỉ? Liệu các phòng thí nghiệm khác có thể sao chép ra năng lực tương tự?

Vấn đề cơ bản hơn là: Anthropic đã tạo ra nó. Dù có công khai hay không, năng lực đã tồn tại. Thay vì tranh cãi về việc công khai hay không, hãy hỏi: trước khi đối thủ cạnh tranh có năng lực tương tự, 50 tổ chức này có thể vá được bao nhiêu lỗ hổng?

Project Glasswing không phải là quản lý rủi ro, mà là chạy đua với thời gian.

Nguồn tham khảo: Anthropic debuts preview of powerful new AI model Mythos in new cybersecurity initiative (TechCrunch); CocoLoop, Anthropic is giving some firms early access to Claude Mythos to bolster cybersecurity defenses (Fortune); Project Glasswing: Securing critical software for the AI era (anthropic.com); Project Glasswing: Anthropic announces big tech consortium to test Claude Mythos (IT Pro)