Claude Sonnet 5.5 ra mắt, nhanh hơn 30% mà giá không đổi

Anthropic phát hành Claude Sonnet 5.5 vào ngày 28 tháng 9, là mô hình thứ hai của họ Claude 5.5 sau Opus 5.5. Công ty đưa ra hai con số chính: nhanh hơn Sonnet 5 ít nhất 30%, và chi phí mỗi tác vụ với hầu hết công việc giảm tối đa 30%. Giá API không đổi, vẫn là 2 đô la cho mỗi triệu token đầu vào, 10 đô la cho token đầu ra, và 0,2 đô la khi đọc từ cache.

Mô hình có mặt ngay trong ngày ra mắt trên nền tảng Claude, AWS, Google Cloud và Microsoft Azure, với tên API là claude-sonnet-5-5, tùy chọn không lưu giữ dữ liệu vẫn được cung cấp như thường trên các nền tảng. Nhà phát triển độc lập Simon Willison nhận thấy tầng miễn phí của claude.ai đã được chuyển sang dùng Sonnet 5.5.

Bảng thành tích chính thức

Đây là những kết quả chính mà Anthropic đưa ra trên trang phát hành:

Bài kiểm traSonnet 5.5
Terminal-Bench 4.070,6%
OSWorld 2.1 (một phần)80,1%
Humanity's Last Exam (có công cụ)64,5%
CursorBench 4.055,5%
FrontierCode 1.1 (Max)46,2%
GDPval-AA v2.11844

Phản hồi của một số khách hàng dùng thử sớm đều tập trung vào tốc độ. Box cho biết mô hình mới nhanh hơn phiên bản trước 2,4 lần, còn Slack nói rằng họ nhận được kết quả tốt hơn và nhanh hơn mà không cần chỉnh lại prompt.

"Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows."

Theo Tyler Nishida của Every, Sonnet 5.5 viết code nhanh và chỉ cần một câu nhắc là có thể chỉnh lại hướng đi trong quá trình lặp.

Góc nhìn khác từ bên thứ ba

Artificial Analysis chấm chỉ số trí tuệ của Sonnet 5.5 là 56 điểm, xếp thứ hai, chỉ thấp hơn 2 điểm so với 58 điểm của Opus 5.5. Trong bài kiểm tra Terminal-Bench 4.0 của riêng họ, Sonnet 5.5 đạt 64%, còn Opus 5.5 và GPT-6 Astra đều đạt 60%. Điểm yếu nằm ở các câu hỏi mang tính thực tế: độ chính xác thực tế chỉ 54%, trong khi Opus 5.5 đạt 66%, và cũng thấp hơn Opus 5.5 6 điểm trong các bài kiểm tra suy luận khoa học.

Phần chi phí lại không khớp với tuyên bố chính thức. Khi chạy toàn bộ bộ bài kiểm tra ở mức suy luận cao nhất (max), Artificial Analysis đo được Sonnet 5.5 tạo ra trung bình khoảng 193.000 token đầu ra cho mỗi tác vụ, nhiều hơn khoảng 60% so với Opus 5.5 và Sonnet 5 ở cùng mức max, và gấp 7 lần GPT-6 Astra. Vì đơn giá không đổi nhưng số token tăng lên, chi phí mỗi tác vụ rơi vào khoảng 7,6 đô la, cao hơn Sonnet 5 khoảng 50%.

Hai cách đo lường này khác nhau. Anthropic nói đến "phần lớn công việc", tức là các tác vụ viết code và viết văn thông thường ở mức cấu hình mặc định; còn Artificial Analysis thử nghiệm tình huống cực hạn khi mở hết ngân sách suy luận. Willison cũng gặp hiện tượng tương tự: khi yêu cầu mô hình viết một ứng dụng WebGL nhỏ ở mức max, nó tiêu tốn 128.000 token và 1,28 đô la; đổi sang mức xhigh, kết quả ra sau 41 giây và chỉ tốn khoảng 0,06 đô la. Anh cũng chỉ ra Sonnet 5.5 có cùng nhược điểm với Opus 5.5: ở mức max rất dễ dùng hết giới hạn token.

So sánh với các mô hình cùng tầm

Nhìn tổng thể, định vị của dòng Sonnet hiện đã rõ: mang lại khoảng 80-90% năng lực của Opus với giá thấp hơn. Khi ra mắt, Sonnet 5 được quảng bá là chỉ tốn khoảng một phần ba chi phí của Opus cho các tác vụ agent; đến thế hệ 5.5, tốc độ được cải thiện và điểm benchmark cũng tiến gần hơn tới Opus 5.5, trên bảng xếp hạng của Artificial Analysis hai mô hình chỉ cách nhau 2 điểm.

Thay đổi ở tầng miễn phí có ảnh hưởng rộng hơn. Theo nhận định của Willison, người dùng miễn phí của claude.ai hiện đang được dùng một mô hình mạnh hơn đáng kể so với dòng Luna mà tầng miễn phí của ChatGPT sử dụng. Về phía OpenAI, GPT-6 Luna theo hướng giá rẻ: dữ liệu mới nhất từ Arena cho thấy chi phí mỗi tác vụ của nó chỉ khoảng 0,05 đô la. Anthropic vẫn chưa công bố Haiku 5.5; Willison dự đoán mô hình này sẽ ra mắt trong vài tuần tới, khi đó tầng giá rẻ mới thực sự đối đầu trực tiếp với Luna.

Đối với các nhà phát triển, việc nên làm ngay là chưa vội mở mức max. Theo dữ liệu công khai hiện tại, mức mặc định hoặc xhigh gần với tuyên bố "nhanh hơn, rẻ hơn" của hãng hơn, còn hóa đơn ở mức max có thể còn cao hơn cả trước khi đổi thế hệ. Anthropic chưa đưa ra bảng chi phí phân theo từng mức, nên muốn biết có đáng hay không với tác vụ cụ thể của mình thì chỉ có cách tự chạy thử.

Nguồn tham khảo: trang phát hành chính thức của Anthropic, blog của Simon Willison, CocoLoop, báo cáo đánh giá của Artificial Analysis; giá API theo trang phát hành của Anthropic, chi phí mỗi tác vụ và lượng token sử dụng theo cách tính ở mức max của chỉ số trí tuệ Artificial Analysis.