Bạn nghĩ AI Agent đang tự động làm việc lâu dài cho bạn? Anthropic đưa ra dữ liệu thực tế — phần lớn tác vụ kết thúc sau 45 giây.
Nhưng một con số khác đáng chú ý hơn: các phiên dài nhất đang tăng tốc gấp đôi.
Phương pháp nghiên cứu
Anthropic đã phân tích hàng triệu tương tác thực tế trên Claude Code và API, nhằm làm rõ ba điều: mức độ tự chủ mà người dùng trao cho Agent, Agent được triển khai trong những bối cảnh nào, và những rủi ro tiềm ẩn.
Đây là lần đầu tiên trong ngành, dữ liệu sử dụng thực tế quy mô lớn được dùng để đo lường mức độ tự chủ của AI Agent, thay vì dựa vào các tiêu chuẩn đánh giá hoặc thí nghiệm trong môi trường sandbox.
Dữ liệu quan trọng nhất
Thời gian phiên trung vị: 45 giây
Phần lớn các tác vụ Agent là ngắn gọn và nhanh chóng. Không phải những dự án phức tạp kéo dài hàng giờ, mà chỉ là một tác vụ nhỏ cụ thể.
Tuy nhiên: Từ tháng 10 năm 2025 đến tháng 1 năm 2026, thời gian phiên ở phân vị 99,9 trên Claude Code tăng từ dưới 25 phút lên hơn 45 phút. Nghĩa là, 0,1% tác vụ dài nhất đã tăng gấp đôi trong ba tháng.
Xu hướng này cho thấy: những người dùng nặng ở cấp cao nhất đang đẩy AI Agent vào các quy trình làm việc ngày càng dài và phức tạp hơn.
Được sử dụng ở đâu
Kỹ thuật phần mềm chiếm 49,7% tổng số lần gọi công cụ. Tỷ lệ này khá trực quan — lập trình viên là nhóm đầu tiên sử dụng Agent trên quy mô lớn, và Claude Code được thiết kế cho bối cảnh này.
Nhưng những con số phía sau thú vị hơn:
| Bối cảnh | Tỷ lệ |
|---|---|
| Kỹ thuật phần mềm | 49,7% |
| Tự động hóa hậu trường | 9,1% |
| Tiếp thị / Viết nội dung | 4,4% |
| Bán hàng / CRM | 4,3% |
| Tài chính / Kế toán | 4,0% |
| Phân tích dữ liệu | 3,5% |
Tự động hóa hậu trường, tài chính, bán hàng đang âm thầm thâm nhập. Đây không phải là bản demo trong phòng thí nghiệm, mà là các doanh nghiệp thực tế đang sử dụng AI Agent để xử lý quy trình kinh doanh thực tế.
Sự giám sát của con người vẫn còn
80% số lần gọi công cụ có ít nhất một biện pháp bảo vệ. 73% có sự can thiệp của con người. Chỉ 0,8% thao tác là không thể đảo ngược.
Những con số này nhìn chung là lạc quan — cho thấy hầu hết doanh nghiệp vẫn giữ van an toàn khi triển khai Agent.
Nhưng hành vi người dùng có một quy luật thay đổi thú vị:
- Người dùng mới: khoảng 20% tác vụ chọn phê duyệt tự động hoàn toàn
- Người dùng có kinh nghiệm (hơn 750 phiên): tỷ lệ tự động hoàn toàn vượt quá 40%
Điều này có vẻ như khi độ tin cậy tăng lên, con người đang trao quyền. Nhưng đồng thời, tỷ lệ gián đoạn cũng tăng — từ 5% lên 9%.
Điều này cho thấy người dùng có kinh nghiệm không buông tay một cách mù quáng, mà đang chuyển sang một cách giám sát khác: từ phê duyệt từng bước một, sang giám sát tổng thể và can thiệp khi có vấn đề.
AI Agent cũng tự động tạm dừng
Một phát hiện bất ngờ: Claude Code yêu cầu làm rõ trong các tác vụ phức tạp với tần suất gấp đôi so với các tác vụ đơn giản, và tần suất tự động tạm dừng này còn cao hơn cả sự gián đoạn thủ công của con người.
Nghĩa là, mô hình có thể tự nhận ra thời điểm "tôi không chắc về điều này, cần hỏi lại". Điều này tinh vi hơn sự giám sát đơn thuần của con người.
Deployment Overhang
Nghiên cứu đưa ra một khái niệm: deployment overhang (độ trễ triển khai).
Ý nghĩa là: mức độ tự chủ mà các mô hình hiện tại xử lý thực tế đã thấp hơn giới hạn năng lực của chúng. Theo thời gian, người dùng sẽ dần đẩy tác vụ đến ranh giới — phiên dài hơn, ít can thiệp hơn, chuỗi tác vụ phức tạp hơn.
Ý nghĩa đối với an toàn là: chỉ dựa vào kiểm tra trước khi phát hành là không đủ, cần xây dựng cơ sở hạ tầng giám sát liên tục sau khi triển khai. Giống như lái xe không chỉ dựa vào kiểm tra xuất xưởng, mà còn cần camera hành trình và thực thi luật giao thông.
Nguồn tham khảo: CocoLoop, Measuring AI agent autonomy in practice (Anthropic Research); The Autonomy Gap: What Anthropic Learned Watching Millions of AI Agent Interactions (Shashi.co)