Chuẩn mới của Microsoft: AI agent chạy 20 lần, chưa nổi nửa số việc ổn định

Microsoft và Hugging Face vừa công bố khung đánh giá AI agent mang tên ThinkingBox cùng bộ chuẩn đi kèm ThinkingBox-Bench. Tiêu chí chấm điểm không dựa vào việc agent tự báo cáo “đã hoàn thành”, mà dựa vào trạng thái thực tế của cơ sở dữ liệu ở backend sau khi agent làm xong việc.

Bộ chuẩn gồm 507 nhiệm vụ nghiệp vụ có trạng thái (stateful), trải trên năm ngành: bán lẻ 98 nhiệm vụ, bảo hiểm ô tô 100, du lịch 104, ngân hàng số 104, tư vấn 101. Mỗi nhiệm vụ được chạy độc lập 20 lần trên một backend sạch, dùng script kiểm tra có thể thực thi để đối chiếu trạng thái cuối của cơ sở dữ liệu và các tác dụng phụ — ví dụ trường dữ liệu cần sửa có được sửa đúng không, có vô tình đụng vào bản ghi không liên quan không.

“The Agent Said It Was Done. The Database Disagreed.”

(Agent nói đã xong. Cơ sở dữ liệu không đồng ý.)

Kết quả của 18 mô hình

Tổng cộng 18 mô hình tham gia đánh giá, gồm cả mô hình đóng nguồn và mô hình mở trọng số. Tính theo tiêu chí “đạt cả 20/20 lần”, Claude Opus 5.5 và Claude Opus 5 đồng hạng nhất, mỗi mô hình giải ổn định 241 nhiệm vụ, đạt 47,53%; GPT-6 Astra xếp thứ ba với 231 nhiệm vụ, đạt 45,56%. Nói cách khác, mô hình tốt nhất vẫn không thể làm đúng tuyệt đối trong hơn một nửa số nhiệm vụ.

Mô hình có độ phủ rộng nhất là Kimi-K3: trong 507 nhiệm vụ, có 476 nhiệm vụ được làm đúng ít nhất một lần, tỷ lệ 93,89%. Nhưng số nhiệm vụ mà nó đạt đúng cả 20 lần chỉ là 68. Cùng một mô hình, nhìn theo pass@20 thì gần như toàn năng, nhìn theo độ ổn định thì lại tụt lại phía sau — hai con số chênh nhau tới bảy lần.

Số liệu về nguyên nhân thất bại cụ thể hơn. Trong 79.853 lần thử “chạy xong bình thường nhưng kết quả sai”, có 77,61% ghi sai giá trị trường dữ liệu, 43,30% gây ra tác dụng phụ ngoài ý muốn (hai loại này có thể xảy ra đồng thời). Nhóm nghiên cứu nhận định khoảng 80% lỗi nằm ở khâu gọi công cụ, ví dụ truyền sai tham số hay gọi sai thứ tự, còn tỷ lệ lỗi do suy luận sai lại nhỏ hơn.

Nhóm nghiên cứu còn đưa ra chỉ số “chi phí cho mỗi nhiệm vụ đáng tin cậy”, tức trung bình phải tốn bao nhiêu tiền để hoàn thành ổn định một nhiệm vụ trong 20 lần chạy: GPT-5.4 là 6,80 USD, GPT-6 Astra là 7,45 USD, Claude Opus 5.5 là 7,80 USD. Thế hệ cũ hơn GPT-5.4 lại xếp trước các mô hình mới ở chỉ số này.

So với các chuẩn đánh giá AI agent hiện có

Dùng nhiều lần chạy để đo độ ổn định không phải ý tưởng mới của ThinkingBox. Chuẩn τ-bench do Sierra công bố năm 2024 đã đưa ra chỉ số pass^k, yêu cầu mô hình thành công liên tiếp k lần trên cùng một nhiệm vụ, khi đó chỉ bao phủ hai lĩnh vực bán lẻ và hàng không. Điểm khác của ThinkingBox là quy mô và cách chấm: số nhiệm vụ mở rộng lên 507, số ngành mở rộng lên năm, và tác dụng phụ được tách riêng thành điều kiện thất bại. Theo cách tính của τ-bench, agent sửa thêm một bản ghi không liên quan chưa chắc bị trừ điểm.

Trang này từng đưa tin về chuẩn Vero của Berkeley, bộ kiểm tra đó cho agent hoàn thành 43 dự án phần mềm, kết quả tốt nhất là làm xong 27 dự án — đo “một lần có thể làm được việc lớn đến đâu”. Hướng đi của ThinkingBox thì ngược lại: nhiệm vụ bản thân không khó, cái cần xem là giao cùng một việc 20 lần, có lần nào sai không. Trong quy trình nghiệp vụ doanh nghiệp, kiểu lỗi sau thường nguy hiểm hơn — sửa sai số tiền bảo hiểm hay trường chuyển khoản một lần, chi phí khắc phục còn lớn hơn nhiều so với một lần làm chưa xong.

Cách sử dụng

Mã nguồn mở theo giấy phép MIT, dữ liệu chuẩn dùng CDLA-Permissive-2.0, môi trường OpenEnv theo BSD-3-Clause, có thể chạy trực tiếp qua giao diện OpenEnv trên Hugging Face. Triển khai cục bộ cần Docker và Typesense để quản lý trạng thái, công cụ được cung cấp qua máy chủ MCP, ngoài ra cần cấu hình ba điểm cuối mô hình: agent được kiểm tra, người dùng giả lập, và mô hình giám khảo.

Người dùng giả lập và giám khảo đều do mô hình đóng vai, bản thân khâu này cũng có thể gây sai số. Bài blog không công bố riêng tỷ lệ đồng thuận giữa mô hình giám khảo và gán nhãn của con người — trước khi có số liệu này, chênh lệch một hai điểm phần trăm giữa các mô hình không nên bị diễn giải quá mức. Tham gia dự án còn có các thực tập sinh từ Đại học Pittsburgh, Đại học California Irvine, Đại học Northwestern và Đại học Columbia.

Nguồn tham khảo: blog Hugging Face, Microsoft Research, CocoLoop, bài báo τ-bench của Sierra; số nhiệm vụ đạt được của từng mô hình, tỷ lệ các loại lỗi và chi phí mỗi nhiệm vụ đều theo số liệu do nhóm ThinkingBox công bố.