Anthropic ra mắt Claude Haiku 5.5 vào ngày 7 tháng 10, đây là mô hình nhỏ đầu tiên của thế hệ Claude 5, trong khi phiên bản Haiku trước đó vẫn dừng ở 4.5. Mô hình mới có mặt ngay trong ngày trên Claude Platform, đồng thời lên AWS, Google Cloud và Microsoft Azure; Claude Code cũng bổ sung mô hình này trong bản cập nhật cùng ngày.
Định vị chính thức cho mô hình này khá hẹp: các tác vụ xử lý theo lô có lưu lượng cao, và vai trò sub-agent cho các mô hình lớn hơn. Giá cả mới là trọng tâm của lần ra mắt này.
Hai mức giá, chia theo độ dài prompt
Haiku 5.5 chia giá theo độ dài của một lượt prompt thành hai mức, với ngưỡng 100.000 token:
| Mỗi triệu token | Haiku 5.5 (≤100k) | Haiku 5.5 (>100k) | Haiku 4.5 |
|---|---|---|---|
| Đầu vào | 0,10 USD | 0,50 USD | 1,00 USD |
| Đầu ra | 0,50 USD | 2,50 USD | 5,00 USD |
| Đọc cache | 0,01 USD | 0,05 USD | 0,10 USD |
| Ghi cache | 0,125 USD | 0,625 USD | 1,25 USD |
Ở mức prompt ngắn, mọi đơn giá đều chỉ bằng một phần mười của Haiku 4.5; ở mức prompt dài thì bằng một nửa. Theo Anthropic, chi phí vận hành tổng thể giảm trung bình khoảng 75%.
Giá đầu vào và đầu ra ở mức ngắn trùng khớp hoàn toàn với GPT-6 Luna mà OpenAI ra mắt cuối tháng 9. Hai mô hình nhỏ của hai hãng giờ đã nằm trên cùng một đường giá.
Cùng ngày, Anthropic cũng giảm giá đọc cache của Sonnet 5.5 từ 0,20 USD xuống 0,10 USD mỗi triệu token, và tặng hạn mức API cho người dùng trả phí: Max 5x nhận 100 USD/tháng, Max 20x nhận 200 USD/tháng, gói Team tối đa 500 USD cho toàn bộ nhóm. Nhà phát triển Simon Willison viết trên blog rằng hạn mức này không được chuyển sang tháng sau nếu không dùng hết.
Điểm benchmark và các mức suy luận
Haiku 5.5 tích hợp sẵn khả năng suy luận và không thể tắt, có thể chọn giữa năm mức low, medium, high, xhigh, max, mặc định là medium. Theo số liệu công bố, mô hình đạt 72,4% trên tập con offline của OSWorld 2.1, 39,2% trên Terminal-Bench 4.0, và trên Humanity's Last Exam đạt 45,9% khi không dùng công cụ, 57,4% khi dùng công cụ.
Một số khách hàng sớm đã công bố số liệu nội bộ của riêng họ. Box cho biết mô hình mới đạt điểm cao hơn Haiku 4.5 11 điểm trên bộ kiểm thử của họ, với độ trễ giảm khoảng một nửa:
"Claude Haiku 5.5 scored 11 points higher than Haiku 4.5 at about half the latency."
(Claude Haiku 5.5 đạt điểm cao hơn Haiku 4.5 11 điểm, với độ trễ giảm khoảng một nửa.)
Asana báo cáo độ trễ giảm hơn 30%, còn HubSpot cho biết đạt điểm cao nhất từng thấy trong bộ kiểm thử này là 92,8%. Đây đều là số liệu khách hàng tự kiểm thử, đề bài không được công khai.
Mức suy luận ảnh hưởng lớn đến chi phí. Simon Willison đã thử cùng một prompt 'vẽ một con chim bồ nông đang đạp xe' ở mức thấp nhất và cao nhất: mức low tốn khoảng 0,0009 USD trong 7 giây; mức max tốn khoảng 0,034 USD trong 5 phút 9 giây, chênh lệch chi phí mỗi lượt hơn 30 lần.
Tính nhanh: bộ tách token ăn mất một phần mức giảm giá
Ngoài bảng giá còn có một biến số dễ bị bỏ qua. Simon Willison chỉ ra rằng Haiku 5.5 đổi bộ tách token, cùng một đoạn văn bản bị tách ra số token bằng khoảng 1,25 lần so với Haiku 4.5.
Tính nhanh theo hệ số này: chi phí đầu vào thực tế ở mức prompt ngắn tương đương 0,125 USD cho mỗi triệu 'token cũ', so với 1 USD của Haiku 4.5, mức giảm khoảng 87%, vẫn rất đáng kể. Ở mức prompt dài thì kém đẹp hơn: 0,50 USD nhân 1,25 bằng 0,625 USD, mức giảm chỉ còn khoảng 37%.
Nếu tính thêm việc suy luận được mở mặc định, số token đầu ra sẽ nhiều hơn so với Haiku 4.5 không suy luận, mức chênh cụ thể tùy vào cấp độ và tác vụ. Với các nhóm làm việc kiểm thử, trích xuất, định tuyến dùng prompt ngắn, đổi mô hình gần như tiết kiệm tiền ngay; còn với các tình huống thường dùng tài liệu dài, ngữ cảnh dài, tốt nhất nên chạy thử lưu lượng thật rồi mới tính hóa đơn.
Về an toàn, Anthropic cho biết giới hạn của Haiku 5.5 với các yêu cầu liên quan an ninh mạng nằm giữa Haiku 4.5 và Sonnet 5.5, còn các biện pháp bảo vệ trong lĩnh vực sinh học tương đương dòng Sonnet 5, các nghiên cứu liên quan cần xin cấp quyền xác minh riêng.
Nguồn tham khảo: trang sản phẩm Claude Haiku 5.5 của Anthropic, blog Simon Willison, CocoLoop, SiliconANGLE; bảng giá của Anthropic được đối chiếu hai mức đơn giá, giá cache so với Haiku 4.5, mức giảm giá đọc cache của Sonnet 5.5 theo thông báo chính thức.