Fable 5.1: giá đọc cache giảm còn một phần tư

Anthropic ra mắt Claude Fable 5.1, mã model claude-fable-5-1, mở đồng thời trên Claude API cùng Bedrock, Google Cloud và Microsoft Foundry. Mythos 5.1 có thông số kỹ thuật và giá hoàn toàn giống nhau, ra mắt cùng đợt nhưng chỉ dành cho khách hàng được mời.

Nền tảng vẫn kế thừa thế hệ trước: cửa sổ ngữ cảnh 1 triệu token tính giá thống nhất trên toàn bộ, đầu ra tối đa 128.000 token, chế độ suy luận thích ứng luôn bật, mốc kiến thức đáng tin cậy đến tháng 6 năm 2026.

Cả bảng giá chỉ đổi đúng một ô

Giá đầu vào 10 đô la, đầu ra 50 đô la mỗi triệu token, giống hệt thế hệ trước; giá ghi cache cũng không đổi. Thứ duy nhất thay đổi là giá đọc cache: Fable 5.1 tính theo 0,025 lần giá đầu vào cơ bản, tức 0,25 đô la mỗi triệu token; các model Claude khác là 0,1 lần.

Mức giảm này chỉ có tác dụng với một kiểu sử dụng: khi cùng một đoạn tiền tố được đọc lại nhiều lần. Thử tính nhanh: một system prompt cộng tiền tố codebase gồm 200.000 token, được đọc lại 100 lần trong một phiên agent chạy vài giờ, tương đương 20 triệu token đọc cache — giá cũ 20 đô la, giá mới 5 đô la. Giá ghi và độ dài tối thiểu có thể cache 512 token đều không đổi; toàn bộ khoản tiết kiệm đến từ hành động "đọc lại" này.

Các agent chạy dài hạn chính là kịch bản đọc lại dày đặc nhất. Việc đặt mức giảm giá đúng vào ô này cho thấy hướng đi khá rõ ràng.

Ba thay đổi khiến ứng dụng báo lỗi ngay lập tức

Ai chuyển từ thế hệ trước sang, chỉ đổi mã model mà không sửa code, sẽ gặp sự cố.

Bắt buộc gọi công cụ (tool_choice) bị loại bỏ. Đặt tool_choice thành any hoặc chỉ định một công cụ cụ thể sẽ trả về lỗi 400 ngay. Lời giải thích chính thức là model này luôn bật chế độ suy luận, việc bắt buộc gọi công cụ sẽ bỏ qua bước suy luận, khiến model viết luôn quá trình suy diễn vào tham số công cụ, làm giảm chất lượng tham số. Muốn có JSON đúng cấu trúc, hãy chuyển sang chế độ nghiêm ngặt (strict mode) hoặc structured outputs.

Khối suy luận (thinking block) giờ nhận diện model tạo ra nó. Mỗi khối suy luận ghi lại nó do model nào sinh ra, và chỉ truyền được theo một chiều: Fable 5.1 đọc được khối suy luận của model đời trước, nhưng ngược lại thì không. Nếu phiên nâng cấp lên model mới, chuỗi suy luận vẫn giữ được; nếu hạ cấp xuống, phần suy luận của những lượt đó sẽ mất. Với routing hay fallback đổi model giữa chừng, API sẽ âm thầm loại bỏ những khối không đọc được, không tính phí và mặc định cũng không báo cho bạn biết.

Sửa lịch sử hội thoại sẽ làm mọi khối suy luận phía sau mất hiệu lực. Chỉ cần động vào bất kỳ thứ gì đứng trước một khối suy luận — system prompt, mảng công cụ, một tin nhắn trước đó — yêu cầu tiếp theo sẽ báo lỗi 400. Quy định này bắt buộc áp dụng với các tài khoản tạo từ ngày 31 tháng 8 trở đi. Lỗi thường gặp nhất là chèn một nhắc nhở tạm thời vào lịch sử ở mỗi lượt rồi xóa đi ở lượt sau, hoặc dựng lại system prompt giữa hai request. Ai dùng client chính thức thì không phải lo; cần tự kiểm tra là những ai tự ghép mảng tin nhắn cho tích hợp riêng.

Tiền tiết kiệm ở đầu vào có thể phải trả lại ở đầu ra

Đáng chú ý hơn cả những thay đổi gây lỗi là các thay đổi hành vi mặc định tự xảy ra dù không sửa code. Anthropic liệt kê tổng cộng bảy điểm, trong đó ba điểm liên quan trực tiếp đến hóa đơn.

Thứ nhất, gọi công cụ song song trở nên kém ổn định hơn: chỗ mà thế hệ trước gửi gộp nhiều lệnh gọi trong một lượt, 5.1 có thể chỉ gửi một lệnh mỗi lượt — tài liệu nói chất lượng câu trả lời không giảm, nhưng nhiều lượt hơn đồng nghĩa tốn thêm token và thêm vòng đi lại. Thứ hai, model có xu hướng viết lại toàn bộ file nhiều hơn; kết quả thường giống nhau, chỉ là tốn thêm token đầu ra. Thứ ba, ở mức nỗ lực (effort) thấp, model ít gọi tìm kiếm hơn, trả lời dựa vào trí nhớ nhiều hơn.

Đặt những điểm này cạnh bảng giá, những gì 5.1 làm không hẳn là giảm giá mà là dịch chuyển chi phí từ phía đầu vào sang phía số lượt. Đọc cache rẻ hơn ba phần tư, nhưng các lệnh gọi công cụ vụn vặt hơn và việc viết lại toàn bộ file lại ngốn vào giá đầu ra 50 đô la mỗi triệu token, đắt gấp năm lần đầu vào. Hóa đơn cuối cùng tăng hay giảm phụ thuộc vào việc bên nào nặng hơn trong vòng lặp agent cụ thể: đọc lại ngữ cảnh liên tục hay xuất nội dung liên tục. Sau khi chuyển đổi, chạy lại đánh giá và tiện thể đối chiếu hóa đơn vẫn là bước không thể bỏ qua.

Trong bốn tính năng beta mới, hai tính năng — đổi mức độ nỗ lực giữa phiên và system message chỉ có hiệu lực trong một lượt — được thiết kế đúng để né những cái bẫy trên. Ngoài ra còn có một tính năng gắn nhãn nội dung được bật mặc định: văn bản tạo ra mang watermark dạng thống kê trên mọi nền tảng, hình ảnh và video lấy về đi kèm chứng nhận C2PA.

Chênh lệch benchmark lớn nhất nằm ở agent nghiên cứu khoa học

Trong bảng so sánh chính thức, mức cải thiện giữa các benchmark rất không đồng đều:

BenchmarkFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1 (agentic scientific research)52.6%24.7%29.0%22.4%
Terminal-Bench 4.0 (agentic coding)55.8%42.0%52.3%37.3%
GDPval-AA v2 (knowledge work, score)1853172318241711
OSWorld 2.0 (computer use, partial / strict)77.9% / 41.7%72.9% / 36.1%75.4% / 39.6%
Humanity's Last Exam (no tools / with tools)60.9% / 65.0%57.8% / 63.8%56.6% / 63.6%
AutomationBench (business workflows)31.4%17.1%26.9%19.6%
CursorBench 3.2.0 (agentic coding)73.4%70.5%70.0%67.2%

Chênh lệch lớn nhất nằm ở agent nghiên cứu khoa học: 52,6% so với 24,7% của thế hệ trước, tăng hơn gấp đôi. Đây cũng là điểm duy nhất mà thế hệ trước rõ ràng thua Opus 5 (24,7% so với 29,0%), 5.1 bù đắp điểm yếu này chứ không phải tăng đều khắp. Cột quy trình nghiệp vụ cũng vậy, 31,4% so với 17,1%. Mythos 5.1 báo riêng 60,9% trên Terminal-Bench 4.0.

Ngược lại, ở những việc thông thường: CursorBench từ 70,5% lên 73,4%, chỉ tăng 2,9 điểm phần trăm; Humanity's Last Exam có công cụ tăng 1,2 điểm phần trăm; công việc tri thức 1853 so với 1824 của Opus 5, chênh 29 điểm. Những con số này khớp với phần định giá — trả gấp đôi tiền là để mua khả năng xử lý tác vụ dài hơi và độ khó cao, còn khoảng cách ở việc viết code hàng ngày và trả lời thông thường nhỏ đến mức chưa chắc đáng giá. Khuyến nghị chính thức cũng theo hướng này: phần lớn khối lượng công việc vẫn nên bắt đầu từ Opus 5, Fable 5.1 dành cho suy luận độ khó cao và agent chạy dài hạn. Chênh lệch giá đã nói lên tất cả — Opus 5 giá 5 và 25 đô la, độ trễ còn thấp hơn.

Nguồn tham khảo: tài liệu model của Anthropic, CocoLoop, trang ghi chú phiên bản; giá, thông số ngữ cảnh và các thay đổi gây lỗi được đối chiếu theo công bố trong tài liệu chính thức; chi phí phiên dài là ước tính sơ bộ dựa trên đơn giá công khai.