Trail of Bits đăng bài ngày 15/9, cho rằng kết luận trong báo cáo benchmark vá lỗi AI của 1Password không đứng vững. 1Password công bố con số 26% "tỷ lệ vá lỗi sạch"; Trail of Bits lấy đúng bộ dữ liệu đó tính lại, ra kết quả trong 3.067 bản vá có 2.634 bản chặn thành công cuộc khai thác lỗ hổng đi kèm, tức 86%.
Hai con số chênh nhau 60 điểm phần trăm, khoảng cách đến từ cách tính điểm.
Bốn điểm bị chỉ ra
Trail of Bits liệt kê bốn vấn đề:
- Mẫu thử quá hẹp: toàn bộ benchmark chỉ dùng 6 lỗ hổng phức tạp, tỷ lệ vá thành công của từng lỗ hổng dao động từ 3% đến 60%, lấy trung bình của chúng để đại diện cho "năng lực vá lỗi của AI" khiến nhiễu thống kê lấn át tín hiệu thật.
- Bản thân prompt có vấn đề: 22% dữ liệu đến từ những thử nghiệm cố tình dẫn agent tới hướng sửa sai. Loại thử nghiệm này đo việc mô hình có bị đánh lừa hay không, chứ không phải nó có sửa đúng hay không.
- Công cụ bị tước bỏ: 36% thử nghiệm không cho phép mô hình biên dịch hoặc chạy thử mã. Lập trình viên con người ở cùng điều kiện khi sửa một lỗ hổng bảo mật cũng khó mà làm tốt hơn.
- Cấu hình không nhất quán: các mô hình khác nhau dùng thiết lập suy luận khác nhau, điểm số giữa chúng không thể so sánh ngang hàng.
Bài viết ghi tên bốn tác giả: Anish Naik, Dan Guido, Benjamin Samuels và Marcelo Morales. Phía 1Password hiện chưa công khai phản hồi về bản phân tích lại này.
Đường mốc con người
Phần thuyết phục hơn trong bài là nó đưa ra một nhóm đối chứng. Trail of Bits dẫn số liệu: trong điều kiện lý tưởng, tỷ lệ thất bại ở lần thử đầu tiên khi lập trình viên vá một lỗ hổng bảo mật vào khoảng 12,5%, tức trung bình sai một trong tám lần.
Có đường mốc này, nhận định "AI vá không sạch" mới có hệ quy chiếu. Tỷ lệ sạch 26% nghe như dưới mức đạt, nhưng đặt 86% cạnh mốc con người 87,5% thì lại thành một câu chuyện khác: xấp xỉ ngang nhau, chưa vượt qua được.
Trail of Bits tiện thể công bố số liệu của dự án riêng Patch the Planet: 186 PR được gửi đi, 126 PR được merge, tỷ lệ merge 67,7%; trong số được merge, 72,2% không cần sửa lại về bảo mật. Bộ số này đo theo tiêu chí khác với thử nghiệm benchmark, nó đo việc "bản vá có được người bảo trì thật chấp nhận hay không", gần với môi trường sản xuất hơn là chỉ đo việc chặn khai thác lỗ hổng.
Hai kỹ năng công bố kèm theo
Cuối bài, hai kỹ năng (skill) cho agent được công bố: post-patch-validation giúp agent tự kiểm tra và xác thực trước khi gửi bản vá, review-walkthrough giúp kỹ sư rà lại các thay đổi mã theo trình tự logic.
Sự tồn tại của hai công cụ này chính là câu trả lời cho bản benchmark kia. 36% thử nghiệm bị cấm biên dịch và chạy thử, còn kỹ năng đầu tiên mà Trail of Bits đưa ra lại chính là xác thực trước khi gửi — điều đó ngụ ý phần lớn chất lượng bản vá phụ thuộc vào việc agent có cơ hội tự kiểm tra hay không.
Các đội trong nước nên nhìn vào đâu khi đọc loại benchmark này
Năm nay nhiều hãng đua nhau công bố bảng điểm vá lỗi AI, tiêu chí mỗi nơi một kiểu. Bài viết này đưa ra một danh sách kiểm tra có thể áp dụng ngay: cỡ mẫu bao nhiêu, có lẫn prompt cố tình gây hiểu lầm hay không, mô hình có được phép biên dịch và chạy thử hay không, cấu hình suy luận giữa các mô hình có nhất quán hay không, có đường mốc con người để đối chiếu hay không. Thiếu một trong năm điều này, con số phần trăm được công bố không thể dùng trực tiếp để chọn giải pháp.
Điểm thực tế hơn cho các đội trong nước là hai kỹ năng này được công bố công khai, có thể đưa thẳng vào quy trình review code của chính mình mà không cần chờ ai cấp phép. Còn đưa vào rồi cải thiện được bao nhiêu thì mỗi codebase một khác, chưa có đáp án sẵn.
Nguồn tham khảo: blog chính thức của Trail of Bits, CocoLoop, báo cáo benchmark của 1Password; bốn điểm nghi vấn về phương pháp luận, số liệu bản vá 3.067 và 2.634, dữ liệu merge 186/126 của Patch the Planet đều lấy theo bài blog gốc.