Fable 5.1 dẫn đầu chỉ số thông minh, chi phí mỗi tác vụ 3.69 USD

Tổ chức đánh giá độc lập Artificial Analysis vừa công bố kết quả kiểm định mới cho Claude Fable 5.1: chỉ số thông minh tổng hợp đạt 66 điểm, đứng thứ nhất trong số 192 mô hình được thử nghiệm. Thế hệ trước, Fable 5, chỉ đạt 62 điểm và xếp thứ sáu.

Cùng bộ kết quả đó còn có một nhóm số liệu khác. Để chạy trọn bộ đánh giá chỉ số thông minh, Fable 5.1 tiêu tốn 8523.16 USD, trong khi Fable 5 chỉ mất 5455.22 USD; quy ra chi phí cho một tác vụ, con số này tăng từ 3.14 USD lên 3.69 USD.

Đơn giá không đổi, nhưng mô hình nói nhiều hơn

Giá niêm yết của hai thế hệ hoàn toàn giống nhau: 10 USD cho mỗi triệu token đầu vào, 50 USD cho mỗi triệu token đầu ra. Toàn bộ khoản chênh lệch hơn ba nghìn USD đến từ độ dài đầu ra — Fable 5 chạy hết bộ đề sinh ra 83 triệu token, còn 5.1 sinh ra 140 triệu token, tăng khoảng 69%. Artificial Analysis đưa ra mức trung vị là 71 triệu token, nghĩa là lượng đầu ra của 5.1 gần gấp đôi mức trung vị.

Điều này khớp với xu hướng chung của các mô hình suy luận trong khoảng một năm qua: năng lực được cải thiện bằng cách để mô hình "suy nghĩ" thêm nhiều bước, còn việc tính phí lại theo token, nên hóa đơn tăng theo độ dài suy luận. Với người dùng trả phí gói thuê bao hàng tháng thì không ảnh hưởng trực tiếp; nhưng với các đội nhóm thanh toán theo API, cùng một khối lượng công việc, ngân sách phải được sắp xếp lại.

Chờ gần năm phút mới thấy token đầu tiên

Cột tốc độ còn gây chú ý hơn. Tốc độ đầu ra của Fable 5.1 là 66.4 token/giây, xếp thứ 84 trong số 192 mô hình, thấp hơn mức trung vị 70; thời gian trả về token đầu tiên là 296.81 giây, trong khi thế hệ trước chỉ mất 116.06 giây — chậm hơn gấp rưỡi.

Con số độ trễ này gần như không thể dùng được trong các tình huống tương tác trực tiếp, nhưng nó đo lường toàn bộ quy trình suy luận — mô hình đã "suy nghĩ" rất lâu trước khi nhả ra ký tự đầu tiên. Đặt vào một tác vụ nền không có người trực tiếp chờ, đợi năm phút không phải vấn đề lớn; nhưng đặt vào tình huống chờ gợi ý hoàn thành mã trong trình soạn thảo thì lại là chuyện khác.

Đặt cạnh GPT-5.6 Sol để so sánh

Cùng trên bảng xếp hạng này, GPT-5.6 Sol của OpenAI đạt 61 điểm, xếp thứ tám, tốn 2017.29 USD để chạy trọn bộ đánh giá, chi phí mỗi tác vụ là 0.95 USD, sinh ra 70 triệu token đầu ra, giá niêm yết 4 USD cho đầu vào và 20 USD cho đầu ra mỗi triệu token.

Tính nhanh một chút: Fable 5.1 có chỉ số thông minh cao hơn 5 điểm, nhưng chi phí mỗi tác vụ gấp 3.9 lần, còn tổng chi phí chạy trọn bộ đề gấp 4.2 lần. Rất khó khẳng định bên nào "đáng đồng tiền" hơn — hai mô hình phù hợp với những loại công việc khác nhau, thời gian tiết kiệm được từ việc làm đúng một tác vụ phức tạp ngay lần đầu chưa chắc đã không bù lại được khoản chênh lệch giá đó. Nhưng điều này lý giải vì sao ngày càng nhiều đội nhóm bắt đầu phân tầng điều phối mô hình: việc khó giao cho mô hình đứng đầu bảng, còn 80% việc vặt còn lại thì giao cho gói rẻ hơn.

Bảng xếp hạng chỉ trả lời một câu hỏi: ai thông minh nhất. Còn người trả tiền thì phải tự trả lời câu hỏi thứ hai: một điểm đó đáng giá bao nhiêu.

Nguồn tham khảo: trang so sánh mô hình của Artificial Analysis, CocoLoop; điểm chỉ số thông minh, tổng chi phí đánh giá, chi phí mỗi tác vụ, lượng token đầu ra và độ trễ token đầu tiên đều lấy từ cùng một vòng kiểm định công khai của tổ chức này.