Sonnet 5.5 đứng thứ 3, GPT-6.1 Sol thứ 5 trên Agent Arena

Nền tảng đánh giá Arena đã bổ sung Claude Sonnet 5.5 (bậc Max) và GPT-6.1 Sol (bậc Max) vào bảng xếp hạng Agent Arena hôm 2/10. Hai mô hình này lần lượt xếp thứ 3 và thứ 5, với tỷ lệ cải thiện ròng 12,52% và 11,23%. Hai vị trí đầu vẫn thuộc về các mô hình của Anthropic: Claude Fable 5.1 (14,31%) và Opus 5.5 (13,82%); vị trí thứ 4 là GPT-6 Astra (12,27%).

Agent Arena khác với cách chấm điểm quen thuộc của các đấu trường văn bản. Nó thống kê các phiên làm việc thực tế mà người dùng sử dụng mô hình như một tác nhân (agent): mô hình phải gọi công cụ, chạy các nhiệm vụ nhiều bước, rồi xem người dùng có hài lòng không. Trang bảng xếp hạng cho biết tổng số phiên đã tích lũy khoảng 2,158 triệu, trải trên 51 mô hình. Tỷ lệ cải thiện ròng tổng hợp độ tin cậy khi gọi công cụ, mức hoàn thành nhiệm vụ và khả năng điều hướng (steerability); ngày 30/9 Arena vừa sửa lại thuật toán đo khả năng điều hướng, từ chỉ xét “sau khi bị sửa có sửa đúng không” mở rộng sang đánh giá mọi lượt phản hồi có thể chấm được trong cuộc hội thoại, mô hình làm đúng ngay từ đầu sẽ được cộng thêm điểm.

Thứ 3 và thứ 5, khoảng cách nằm trong sai số

Chỉ nhìn xếp hạng, Sonnet 5.5 vượt qua GPT-6 Astra và GPT-6.1 Sol. Nhưng khi tính cả biên sai số thì bức tranh khác hẳn: điểm của Sonnet 5.5 là 12,52% ± 3,09%, còn GPT-6.1 Sol là 11,23% ± 2,76%, hai khoảng này chồng lấn phần lớn, và chỉ cách vị trí thứ 4 (Astra) 0,25 điểm phần trăm. Vì mô hình mới lên bảng, số phiên mẫu còn ít nên biên sai số rộng hơn nhiều so với Opus 5.5 (± 2,17%). Với dữ liệu hiện tại, rất khó nói chắc ai trong nhóm thứ 3 đến thứ 5 thực sự mạnh hơn.

Ở các mục con, hai bên mỗi bên có điểm mạnh riêng. Sonnet 5.5 đứng đầu mục khả năng phục hồi sau khi lệnh Bash thất bại, đạt 15,05%; GPT-6.1 Sol đứng đầu mục ảo giác công cụ (tool hallucination), tỷ lệ bịa ra công cụ không tồn tại chỉ 0,49%, và xếp thứ 2 ở mục “người dùng xác nhận nhiệm vụ hoàn thành” với 15,47%.

Hóa đơn mới là thứ kéo khoảng cách ra xa

Giá API của hai mô hình thực ra giống nhau: 2 đô la cho mỗi triệu token đầu vào, 10 đô la cho mỗi triệu token đầu ra. Nhưng khi vào các nhiệm vụ dạng agent, chi phí cho một nhiệm vụ lại chênh nhau nhiều lần. Trang chi phí của Arena cho thấy:

Mô hìnhTỷ lệ cải thiện ròngChi phí mỗi nhiệm vụ
Claude Fable 5.114,31%khoảng 4,91 đô la
Claude Opus 5.513,82%khoảng 1,56 đô la
Claude Sonnet 5.512,52%khoảng 2,99 đô la
GPT-6 Astra12,27%khoảng 3,10 đô la
GPT-6.1 Sol11,23%khoảng 0,58 đô la
DeepSeek V4.1 Flash4,02%khoảng 0,11 đô la

Giá token giống nhau nhưng chi phí mỗi nhiệm vụ chênh khoảng 5 lần, sự khác biệt nằm ở lượng token tiêu thụ. Ở bậc Max, Sonnet 5.5 có xu hướng viết dài hơn và “suy nghĩ” lâu hơn; các đánh giá độc lập trước đó cũng cho thấy nó tiêu tốn nhiều token hơn thế hệ trước cho mỗi nhiệm vụ. Kết quả là nó có điểm thấp hơn mà lại tốn kém hơn so với Opus 5.5 — mô hình lớn hơn trong cùng dòng Claude — và không lọt vào đường biên hiệu quả chi phí (Pareto frontier) mà Arena đánh dấu. Đường biên này hiện được nối bởi bốn điểm: Fable 5.1, Opus 5.5, GPT-6.1 Sol và DeepSeek V4.1 Flash.

GPT-6.1 Sol chính là mô hình đã vẽ lại đường biên lần này. Theo so sánh Arena đưa ra khi công bố: chi phí trung vị mỗi nhiệm vụ của nó thấp hơn 39% so với bản GPT-6 Sol trước đó, nhưng điểm lại cao hơn 1,52 điểm phần trăm; so với GPT-6 Astra thì rẻ hơn 81%, trong khi khoảng cách điểm số chỉ trong phạm vi 1,04 điểm phần trăm. GPT-6.1 Sol ra mắt chưa đầy một tuần đã thay thế GPT-6 Sol, và bảng xếp hạng này cho OpenAI một minh chứng từ bên thứ ba rằng mô hình “rẻ mà không mất điểm”.

Bộ số liệu chi phí này cũng có giới hạn về phạm vi thống kê. Arena thống kê các phiên do người dùng khởi tạo trên nền tảng của mình, loại nhiệm vụ chủ yếu là viết code, tra cứu thông tin, chạy lệnh — phân bố này chưa chắc giống với luồng công việc thực tế trong doanh nghiệp; chi phí được quy đổi theo mức giá API thực tế mà Arena gọi, còn hóa đơn doanh nghiệp dùng chiết khấu cache hay chiết khấu theo lô sẽ thấp hơn. Nếu dùng bảng này để ra quyết định mua sắm, tốt nhất nên tự lấy mẫu kiểm tra lại trên nhiệm vụ của mình trước.

So với thế hệ trước

Nhìn lại theo thời gian, dòng Sonnet trên Agent Arena vẫn liên tục tiến lên. Thế hệ trước, Sonnet 5, khi mới lên bảng xếp thứ 6; lần này 5.5 đã vào top 3. Phía OpenAI lại có nhịp độ khác: GPT-6 Sol lên bảng ngày 25/9 với tỷ lệ cải thiện ròng 9,71%, một tuần sau 6.1 Sol thay thế, điểm tăng thêm khoảng một điểm rưỡi, chi phí giảm khoảng 40%.

Với các nhà phát triển, chọn mô hình nào để chạy agent phụ thuộc vào khối lượng công việc. Nếu chỉ chạy vài nhiệm vụ phức tạp không thường xuyên, những mô hình điểm cao và giá không quá đắt như Opus 5.5 sẽ an tâm hơn; nếu cần chạy số lượng lớn và tính theo lượng dùng, các điểm chi phí thấp như GPT-6.1 Sol hay DeepSeek V4.1 Flash sẽ hợp lý hơn. Còn Sonnet 5.5, nếu chuyển sang bậc suy luận thấp hơn thì chi phí và điểm số sẽ rơi vào đâu — hiện Arena mới chỉ đo ở bậc Max, chưa có dữ liệu.

Nguồn tham khảo: bảng xếp hạng Agent Arena của Arena, trang đường biên chi phí của Arena, CocoLoop, tài khoản chính thức của Arena, Artificial Analysis; tỷ lệ cải thiện ròng, biên sai số và chi phí mỗi nhiệm vụ của từng mô hình lấy theo số liệu hiển thị trên trang Arena.