Ngày 5 tháng 2, Anthropic phát hành Opus 4.6, với nâng cấp cốt lõi mang tên Adaptive Thinking (Tư duy thích ứng).
Trước đây so với hiện tại
Trước đây khi dùng extended thinking, phải thủ công đặt ngân sách — cho mô hình suy nghĩ 10 giây hay 30 giây hoàn toàn do nhà phát triển quyết định. Giờ đây Opus 4.6 tự quyết:
- Câu hỏi đơn giản → trả lời ngay, không lãng phí tài nguyên tính toán
- Câu hỏi phức tạp → tự động vào chế độ suy luận sâu
- Tài nguyên tính toán được phân bổ theo nhu cầu
Nguyên lý cơ bản là mô hình thực hiện đánh giá độ khó ngay khi nhận prompt, sau đó điều chỉnh động độ sâu suy luận. Có bốn mức điều chỉnh thủ công (low/medium/high/max), mặc định là high.
Cửa sổ ngữ cảnh tối đa
- Ngữ cảnh: 1 triệu token (beta)
- Đầu ra tối đa: 128K token
- Độ chính xác truy xuất MRCR v2: 93% ở ngữ cảnh 256K, vẫn đạt 76% khi kéo lên 1 triệu
So sánh, độ tin cậy truy xuất của Sonnet 4.5 trong cùng bài kiểm tra chỉ bằng một phần tư đến một phần chín so với Opus 4.6. Khoảng cách không hề nhỏ.
Cải thiện rõ rệt trong tác vụ agent
| Benchmark | Điểm số |
|---|---|
| Terminal Bench | 59,8% → 65,4% |
| OSWorld | 66,3% → 72,7% |
Cả hai chỉ số đều vượt qua GPT-5.2 và Gemini 3 Pro.
Một tính năng mạnh khác là Compaction API — tự động nén lịch sử hội thoại phía máy chủ, về lý thuyết hỗ trợ hội thoại dài vô hạn. Trong các tác vụ agent chạy hàng chục lượt tương tác để hoàn thành nhiệm vụ lập trình phức tạp, khả năng này quyết định trực tiếp tỷ lệ thành công.
Nguồn tham khảo: Bài báo về Opus 4.6 trên The New Stack, CocoLoop, tài liệu chính thức của Anthropic