Claude định vị ảnh sai số 37km, vượt con người

Ngày 10 tháng 9, đội Frontier Red Team và đội tình báo mối đe dọa của Anthropic công bố một báo cáo đánh giá xem các mô hình AI có thể làm được gì trong các nhiệm vụ quân sự và tình báo. Nhiệm vụ chia làm hai nhóm: một là định vị tình báo, gồm liên kết tài khoản trên các nền tảng mạng xã hội khác nhau về cùng một người, suy ra địa điểm từ ảnh và văn bản; hai là phát triển vũ khí thông thường, gồm dẫn đường giai đoạn cuối cho máy bay không người lái, thả tải trọng, và điều hướng tự động khi GPS bị gây nhiễu.

Các mô hình tham gia thử nghiệm gồm Mythos Preview, Mythos 5, Opus 5, Sonnet 5 của Anthropic, cùng mô hình trọng số mở Kimi K3. Kết luận chung của báo cáo là:

"For some tasks in military and intelligence domains, models could do things that, historically, only a set of scarce, highly-trained human experts could do."

Trong một số nhiệm vụ thuộc lĩnh vực quân sự và tình báo, các mô hình có thể làm được những việc mà trước đây chỉ một nhóm ít ỏi chuyên gia con người được đào tạo chuyên sâu mới làm nổi.

Nhận diện địa điểm: cả ảnh lẫn văn bản đều được

Với định vị từ ảnh, bài kiểm tra dùng 6.000 ảnh chụp ngoài trời từ bộ dữ liệu công khai của Flickr, đã xóa metadata và cấm tìm kiếm ảnh ngược. Sai số trung vị của Mythos Preview là 37,0 km, với 23,7% số ảnh được định vị trong bán kính 1 km; nhóm đối chứng là những người chơi cạnh tranh trò đoán địa lý GeoGuessr, có sai số trung vị 151 km. Opus 5 đạt 181 km, còn Sonnet 5 và Kimi K3 đều quanh mức 385 km.

Với định vị từ văn bản, bài kiểm tra dùng một kho dữ liệu tweet bao phủ 1.697 người dùng, mô hình được phép dùng công cụ tìm kiếm. Sai số trung vị của Mythos Preview, Mythos 5 và Opus 5 đều nằm trong khoảng 20-22 km, và có 135 người dùng (khoảng 8%) bị ít nhất một mô hình định vị trong bán kính 1 km.

Nhiệm vụ liên kết tài khoản trải rộng trên các nền tảng như WhatsApp, Instagram, Facebook, tổng cộng 200 câu hỏi. Báo cáo đưa ra so sánh hiệu suất: với một tài liệu 37.000 từ, mô hình phân tích xong trong khoảng 11 phút, trong khi con người chỉ đọc lướt qua một lượt đã mất 2,5 giờ.

Bắn mục tiêu: đứng yên thì dễ, GPS bị đánh lừa thì loạn

Bài kiểm tra dẫn đường giai đoạn cuối cho máy bay không người lái thiết lập 9 kịch bản, gồm mục tiêu di chuyển, mục tiêu ngụy trang và chướng ngại vật ven đường:

Mô hìnhMục tiêu tĩnh, độ tương phản caoMục tiêu di chuyểnTổng hợp 9 kịch bản
Opus 580%47%20%
Mythos Preview70%20%13%
Mythos 553%17%10%
Kimi K315%1,6%1,6%
Sonnet 55%0%0,7%

Với thả tải trọng, điểm rơi trong bán kính 5 mét quanh mục tiêu được tính là trúng. Trên mục tiêu tĩnh, Opus 5 và Mythos 5 gần như trúng toàn bộ, sai số trung vị 20-30 cm; khi mục tiêu di chuyển với tốc độ 3 mét/giây, Mythos Preview và Opus 5 lần lượt đạt 77% và 76%; khi có thêm gió, chỉ còn Opus 5 giữ được tỷ lệ trúng 28%.

Điều hướng bằng GPS được chia thành ba điều kiện. Khi tín hiệu bình thường, tất cả mô hình trừ Sonnet 5 đều bay tới đích được; khi GPS bị chặn, Opus 5 dừng lại cách mục tiêu 15-20 mét, 33% số lượt bay vào trong bán kính 5 mét, còn dòng Mythos dừng ở khoảng 30 mét; khi chuyển sang giả mạo tín hiệu kín đáo và trôi dạt liên tục, tất cả các mô hình đều mất độ chính xác.

Kimi K3 được dùng làm mốc tham chiếu mã nguồn mở

Báo cáo mô tả mô hình trọng số mở nhìn chung tụt sau các mô hình tiên phong, thành tích thường nằm giữa cấp Sonnet và cấp Mythos, nhưng đã sở hữu những năng lực đáng lo ngại. Báo cáo cũng viết rằng bản thân các mô hình tiên phong đã dễ dàng vượt qua ngưỡng này, và hệ sinh thái mã nguồn mở cũng đang bám sát rất gần, "không nên nhầm khoảng cách này với sự an toàn".

Trong phần khuyến nghị chính sách, báo cáo chủ trương giữ vững lợi thế chip của "các nước dân chủ" để hạn chế tốc độ tiến bộ AI của đối thủ. Cùng tuần đó, Anthropic còn công bố một báo cáo tình báo mối đe dọa, nêu đích danh nhiều phòng thí nghiệm Trung Quốc chưng cất Claude ở quy mô lớn.

Kết quả chỉ tính là giới hạn dưới

Báo cáo liệt kê một số giới hạn: dữ liệu là tổng hợp hoặc mô phỏng, bài kiểm tra máy bay không người lái dùng hình ảnh render đơn giản hóa, chưa chạy trên phần cứng thật; mô hình chạy trong sandbox cách ly, không kết nối internet, cũng không có quyền truy cập kho mã nguồn đầy đủ có sẵn. Dựa trên đó, Anthropic gọi những kết quả này là "giới hạn dưới chứ không phải giới hạn trên" của năng lực.

Về mặt phòng ngừa, Anthropic cho biết sau khi phát hiện Claude bị lạm dụng trong lĩnh vực phát triển vũ khí, hãng đã triển khai bộ phân loại mới để phát hiện và chặn các yêu cầu liên quan. Báo cáo không công bố số lượng bị chặn hay tỷ lệ chặn nhầm của bộ phân loại này.

Nguồn tham khảo: Báo cáo nghiên cứu của Frontier Red Team thuộc Anthropic, CocoLoop, tài liệu công khai của đội tình báo mối đe dọa Anthropic; tỷ lệ trúng và sai số định vị của từng mô hình theo đúng cách đo trong bài kiểm tra mô phỏng mà báo cáo công bố.