Nếu bạn vẫn đang đau đầu về việc có nên mua hạn mức API của Claude Opus 4.6 hay không, bài viết này có thể giúp bạn tiết kiệm một khoản tiền.
Anthropic đã phát hành Claude Sonnet 4.6 vào tháng 2, với mức giá hoàn toàn giống Sonnet 4.5 – đầu vào 3 USD/triệu token, đầu ra 15 USD/triệu token – nhưng điểm số benchmark đã áp sát Opus 4.6, vốn đắt gấp 5 lần.
Số liệu biết nói
Trước hết, hãy xem bảng so sánh trực quan nhất:
| Benchmark | Sonnet 4.6 | Opus 4.6 | Chênh lệch |
|---|---|---|---|
| SWE-bench Verified (lập trình) | 79,6% | 80,8% | -1,2% |
| OSWorld-Verified (điều khiển máy tính) | 72,5% | 72,7% | -0,2% |
| Toán học (MATH-500) | 89% | Chưa công bố | — |
| GPQA Diamond (suy luận khoa học) | 74,1% | 91,3% | -17,2% |
Về lập trình và điều khiển máy tính – tức những tác vụ mà hầu hết doanh nghiệp dùng Claude để làm – Sonnet 4.6 gần như đã ngang bằng Opus 4.6. Khoảng cách thực sự chỉ xuất hiện ở các tác vụ học thuật như suy luận khoa học, nơi Opus 4.6 đạt 91,3% so với 74,1% của Sonnet – một chênh lệch không thể bỏ qua.
Tuy nhiên, nếu trường hợp sử dụng của bạn chủ yếu là viết mã, điều khiển trình duyệt và xử lý tài liệu dài, thì việc trả gấp 5 lần giá để đổi lấy 1,2 điểm phần trăm cải thiện về lập trình – tính toán ra bạn sẽ thấy đó không phải lựa chọn thông minh.
Đường cong điều khiển máy tính dốc đến mức nào
Anthropic đã công bố một loạt dữ liệu cho thấy sự tiến hóa điểm số OSWorld-Verified (bài kiểm tra tiêu chuẩn đo lường khả năng AI tự động điều khiển máy tính) trong 16 tháng qua:
- Sonnet 3.5: 14,9%
- Sonnet 3.5 v2: 28,0%
- Sonnet 3.6: 42,2%
- Sonnet 4.5: 61,4%
- Sonnet 4.6: 72,5%
Trong một năm rưỡi, từ 14,9% lên 72,5%, đường cong này dốc hơn nhiều so với những gì đa số mọi người cảm nhận. Khi thử nghiệm tự động hóa quy trình làm việc trong ngành bảo hiểm, Sonnet 4.6 đạt độ chính xác 94%, bao gồm các tác vụ khó nhằn như thao tác bảng tính Excel phức tạp, điền biểu mẫu web nhiều bước và gọi ứng dụng desktop cũ.
Toán học nhảy vọt một mảng lớn
Sonnet 4.5 đạt 62 điểm môn toán, Sonnet 4.6 nhảy thẳng lên 89 điểm. Đây là mức cải thiện đơn lẻ lớn nhất trong cùng một thế hệ. Anthropic không công bố chi tiết lý do cụ thể, nhưng kết hợp với sự cải thiện tổng thể về khả năng suy luận, rất có thể liên quan đến chất lượng chuỗi suy nghĩ (chain-of-thought) tốt hơn.
Dữ liệu ưu tiên của người dùng
Anthropic đã thực hiện một loạt thử nghiệm nội bộ Claude Code, cho phép các nhà phát triển so sánh chất lượng đầu ra mà không biết mô hình nào đứng sau:
- Sonnet 4.6 so với Sonnet 4.5: 70% người dùng chọn Sonnet 4.6
- Sonnet 4.6 so với Opus 4.5: 59% người dùng chọn Sonnet 4.6
Nhóm dữ liệu thứ hai thú vị hơn. Opus 4.5 đắt hơn Sonnet 4.6 rất nhiều, nhưng trong đánh giá chủ quan về đầu ra lập trình thực tế, Sonnet 4.6 lại được ưa chuộng hơn. Các lý do được đưa ra bao gồm: tuân thủ hướng dẫn chính xác hơn, ít ảo giác hơn, không thiết kế quá mức cần thiết (đây là vấn đề tồn tại lâu nay của dòng Opus – nó thích làm phức tạp những yêu cầu đơn giản).
Ngữ cảnh 1M không phải chiêu trò
Lần này Sonnet 4.6 cũng được trang bị cửa sổ ngữ cảnh 1 triệu token (phiên bản beta), không cần header bổ sung, các yêu cầu vượt quá 200k sẽ tự động đi qua kênh này và được tính giá theo tiêu chuẩn.
1 triệu token tương đương với khoảng bao nhiêu? Toàn bộ kho mã nguồn của một doanh nghiệp vừa, hoặc hàng chục bài báo khoa học, đều có thể nhét vào một yêu cầu duy nhất để xử lý. Những tình huống trước đây cần phải cắt nhỏ RAG, giờ chỉ cần ném thẳng vào và để nó tự tìm mối liên quan.
Bạn nên chọn cái nào
Chọn Sonnet 4.6 nếu:
- Nhiệm vụ chính là viết mã, điều khiển trình duyệt, xử lý tài liệu dài
- Khối lượng truy vấn lớn, nhạy cảm về giá
- Không cần suy luận khoa học trình độ tiến sĩ
Chọn Opus 4.6 nếu:
- Cần suy luận khoa học cường độ cao hoặc tác vụ học thuật
- Nhu cầu ngữ cảnh cực kỳ phức tạp
- Không quan tâm đến chênh lệch giá, chỉ muốn kết quả tốt nhất
Đối với hầu hết nhà phát triển và doanh nghiệp, Sonnet 4.6 hiện là cửa ngõ Claude có hiệu suất giá tốt nhất. Opus 4.6 có giá 15/75 USD, Sonnet 4.6 là 3/15 USD, cùng khả năng lập trình nhưng chênh lệch giá gấp 5 lần. Phép tính này không khó chút nào.
Nguồn tham khảo: Introducing Claude Sonnet 4.6 (Anthropic chính thức); CocoLoop; Claude Sonnet 4.6: 79.6% SWE-bench at $3/MTok — Complete Guide (NxCode); Claude Sonnet 4.6: 1M context and stronger computer use (Gend.co)