Nền tảng đánh giá mô hình Arena thông báo vào rạng sáng ngày 27/9 giờ Bắc Kinh rằng Claude Opus 5.5 (High) ngay lần đầu xuất hiện trên Text Arena đã vươn lên vị trí số 1, đạt 1509 điểm. Con số này cao hơn 18 điểm so với thế hệ trước Opus 5 (High), hiện đang xếp thứ 11.
Text Arena là bảng xếp hạng lâu đời nhất của Arena: người dùng xem đồng thời câu trả lời của hai mô hình ẩn danh rồi bình chọn cho câu trả lời tốt hơn, sau đó nền tảng quy đổi thành điểm số theo phương pháp kiểu Elo. Bảng xếp hạng này đã tích lũy hơn 8,5 triệu lượt bình chọn, bao phủ các dạng câu hỏi về viết lách, lập trình, toán học và hỏi đáp đời thường.
Sáu vị trí đầu đều thuộc về Anthropic
Sau đợt cập nhật này, sáu vị trí dẫn đầu Text Arena đều thuộc về Anthropic. Theo thứ tự xếp hạng trên trang Arena:
| Hạng | Mô hình | Điểm | Lượt bình chọn |
|---|---|---|---|
| 1 | Claude Opus 5.5 (High) | 1509 ±12 | 2.307 |
| 2 | Claude Opus 4.6 (High) | 1505 ±3 | 76.518 |
| 3 | Claude Fable 5 (High) | 1504 ±4 | 36.462 |
| 4 | Claude Opus 4.7 (High) | 1502 ±4 | 64.007 |
| 5 | Claude Fable 5.1 (Max) | 1501 ±7 | 9.942 |
| 6 | Claude Opus 4.6 | 1498 ±3 | 80.836 |
Vị trí thứ bảy thuộc về Muse Spark 1.2 (xHigh) của Meta với 1496 điểm; đại diện cao nhất của Google là Gemini 3.8 Flash (High) xếp thứ 10 với 1492 điểm. Trong top 15 chỉ có ba cái tên Anthropic, Meta và Google; dòng GPT-6 mà OpenAI vừa ra mắt ngày 22/9 không xuất hiện trong khoảng này.
Arena cũng đánh dấu Opus 5.5 nằm trên đường biên hiệu quả chi phí của Text Arena. Tính theo giá đầu vào và đầu ra, đơn giá hỗn hợp của nó là 16 USD cho mỗi triệu token. Anthropic định giá API cho Opus 5.5 là 4 USD cho đầu vào và 20 USD cho đầu ra, đều giảm một phần năm so với Opus 5.
Số lượt bình chọn vẫn còn quá ít
Khoảng cách giữa vị trí số 1 và số 6 chỉ là 11 điểm, trong khi sai số của chính Opus 5.5 đã là ±12. Nói cách khác, từ vị trí thứ nhất đến thứ sáu, các mô hình này về mặt thống kê vẫn chưa thể phân biệt cao thấp.
Nguyên nhân nằm ở số lượt bình chọn. Opus 5.5 ra mắt chưa đầy một tuần, mới tích lũy được 2.307 lượt; trong khi Opus 4.6 (High) xếp ngay sau đã có hơn 76.000 lượt, sai số chỉ ±3. Mô hình mới khi vừa lên bảng xếp hạng thường có sai số rộng, điểm số dao động mạnh - đây là điều bình thường ở Arena, những tuần tới điểm số tăng hay giảm đều có thể xảy ra.
Khi đăng bài, Arena cũng chỉ nói mô hình này “lần đầu xuất hiện đã đứng đầu”, không đưa ra xếp hạng theo từng hạng mục. Trong các bảng con về lập trình, toán học, viết sáng tạo, Opus 5.5 đứng ở vị trí nào, phía chính thức hiện chưa công bố.
Vì sao Opus 5 lại xếp sau các mô hình cũ hơn
Điều đáng chú ý hơn trên bảng xếp hạng này là Opus 5. Xét theo thứ tự ra mắt, nó mới hơn cả Opus 4.6 và 4.7, nhưng trên Text Arena lại chỉ xếp thứ 11, kém Opus 4.6 (High) 14 điểm, và kém cả Fable 5 (High) cùng nhà 13 điểm.
Text Arena đo lường việc người dùng thích câu trả lời nào hơn khi so sánh ẩn danh, điều này không đồng nghĩa với tỷ lệ giải đúng. Độ dài, giọng văn, định dạng của câu trả lời đều ảnh hưởng đến lượt bình chọn; một mô hình mạnh hơn về suy luận hoàn toàn có thể thua trong bình chọn sở thích vì viết dài dòng hoặc giống tài liệu hướng dẫn quá mức.
Thế hệ này Anthropic đã đầu tư công sức vào khả năng viết. Trước đây các kỹ sư của công ty từng công khai giải thích lý do vì sao khả năng viết của Claude từng đi xuống, cho rằng tỷ lệ phần thưởng trong học tăng cường khiến mô hình ngày càng viết như thể viết cho AI đọc; Opus 5.5 là phiên bản đầu tiên cải thiện có chủ đích về độ rõ ràng của câu văn. Trong 18 điểm mà Opus 5.5 vượt qua Opus 5, có bao nhiêu đến từ điều chỉnh về viết lách và bao nhiêu đến từ năng lực bản thân, dữ liệu của Arena không thể tách bạch, Anthropic cũng chưa đưa ra đánh giá tương ứng.
Nhìn xâu chuỗi qua các thế hệ: Opus 4.6, 4.7 đến nay vẫn nằm trong top 4, Opus 5 ra mắt nhưng không kế thừa được vị trí, phải đến Opus 5.5 mới đổi được gương mặt mới cho ngôi số 1. Hiện tại đối thủ chính của Anthropic trên bảng xếp hạng thiên về sở thích này chính là các phiên bản cũ của hãng.
Nguồn tham khảo: tài khoản chính thức của Arena, bảng xếp hạng Arena Text, CocoLoop, trang định giá mô hình của Anthropic; điểm số, sai số và số lượt bình chọn theo dữ liệu hiện tại trên trang Arena.