Ở mức 200 USD, hạn mức Claude gấp khoảng 5 lần OpenAI

Viện nghiên cứu bán dẫn và AI SemiAnalysis công bố ngày 5/10 một báo cáo thực đo hạn mức thuê bao, với kết luận thẳng: ở mức 200 USD/tháng, khi chạy tải công việc dạng agent bằng các mô hình hạng trung, giá trị API quy đổi từ thuê bao Anthropic cao gấp hơn 5 lần so với OpenAI. Hai mô hình được so sánh là Claude Opus 5.5 và GPT-6.1 Sol.

Báo cáo do Andrew Megalaa, Max Kan và Dylan Patel đứng tên, phạm vi thử nghiệm bao gồm thuê bao của Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Z.ai, cùng hai sản phẩm wrapper là Cursor và Cognition.

Hạn mức được đo như thế nào

Cả hai bên đều không công khai hạn mức thuê bao tương ứng bao nhiêu token, chỉ đưa ra một thước đo phần trăm sử dụng, cộng với hai khung giới hạn tốc độ là 5 giờ và 7 ngày. Cách làm của SemiAnalysis là suy ngược: tách riêng bốn loại token là đầu vào, ghi cache, đọc cache và đầu ra, đo xem mỗi loại token làm thước đo sử dụng nhảy bao nhiêu, rồi quy đổi số đọc được ở hai khung thời gian thành tổng lượng token dùng được mỗi tháng, cuối cùng tính ra USD theo đơn giá API chính thức.

Theo Implicator tường thuật, nhóm nghiên cứu đã nạp từng đoạn tác phẩm "Chiến tranh và Hòa bình" vào các tài khoản trả phí, dùng thẻ ngẫu nhiên để tạo input hoàn toàn mới, dùng thẻ cố định để đo tỷ lệ cache hit, dùng văn bản kỹ thuật dài để ép ra output dài, lặp lại nhiều lần cho đến khi sai số thu hẹp về trong khoảng ±5%.

Hai bên đang điều chỉnh hạn mức theo hai hướng ngược nhau

Đợt thử nghiệm này trùng với một lần điều chỉnh riêng của mỗi bên.

OpenAI mở lại gói Pro 200 USD vào ngày 30/9, đồng thời đổi sang cách quy đổi hạn mức theo chi tiêu API. Người đứng đầu Codex, Thibault Sottiaux, lúc đó nói:

"If you do the math, it will net out at half the dollar in API spend compared to the old Pro $200 plan."
(Tính ra, mức chi API quy đổi chỉ còn bằng một nửa so với gói Pro 200 USD cũ.)

Chi tiết mà SemiAnalysis trích dẫn là hạn mức của phân khúc này trong Codex và Work giảm từ 20 lần của Plus xuống còn 10 lần, đồng thời thêm một gói Pro 500 USD ở trên. Báo cáo mô tả cách làm của OpenAI là cắt thẳng hạn mức ở tất cả các phân khúc.

Anthropic lại đi theo hướng ngược lại: đơn giá API đầu vào và đầu ra của Opus 5.5 giảm 20%, đọc cache giảm 60%, đồng thời nâng hạn mức Opus ở gói Max lên khoảng 20%, gói Pro lên khoảng 50%. Theo phân tích của báo cáo, cách Anthropic siết lợi nhuận là kéo cao mức tiêu hao hạn mức của mô hình flagship Fable so với Opus, chứ không phải cắt hạn mức tổng thể.

Vì vậy, con số "5 lần" chủ yếu xuất hiện ở phân khúc mô hình hạng trung. Lên đến phân khúc flagship, SemiAnalysis cho rằng hạn mức của Fable 5.1 và GPT-6 Astra không chênh nhau nhiều.

Thử tính nhanh chi phí của thuê bao

Báo cáo đưa ra một cặp tỷ lệ nói lên nhiều điều: thuê bao chỉ chiếm khoảng 10% doanh thu của Anthropic, nhưng có thể ăn hơn 40% năng lực tính toán suy luận.

Tính nhanh theo hai tỷ lệ này: mỗi 1 phần năng lực tính toán mà thuê bao dùng, mang về khoảng 0,25 phần doanh thu; mỗi 1 phần năng lực tính toán mà API và các mảng kinh doanh khác dùng, mang về khoảng 1,5 phần doanh thu. Chênh nhau khoảng 6 lần. Đây chỉ là suy luận đơn giản dựa theo tỷ lệ của báo cáo, chưa tính đến cache hit, điều phối theo giờ cao thấp điểm, và Anthropic cũng chưa từng công bố cách tính của riêng mình.

Khoảng cách này có thể giải thích hai việc: vì sao OpenAI chấp nhận rủi ro mất người dùng để cắt hạn mức; vì sao Anthropic vừa tăng hạn mức cho Opus vừa nâng hệ số tiêu hao của Fable. Với các nhà phát triển dùng nhiều Claude Code, thuê bao hiện vẫn lợi hơn nhiều so với trả theo lượng dùng, còn trạng thái này kéo dài được bao lâu thì tùy vào mức Anthropic còn muốn bù lỗ đến đâu.

Phần nằm sau tường phí

Phần công khai của báo cáo dừng ở mục "thuê bao qua wrapper bên thứ ba không lợi bằng thuê bao chính thức" thì vào tường phí, các sản phẩm như Cursor, Devin chênh nhau cụ thể bao nhiêu thì bản công khai không có số liệu. Thuê bao của các hãng trong nước như MiniMax, Moonshot, Z.ai được đo ra sao, các bên đưa tin cũng không đồng nhất, nên không trích dẫn ở đây.

Cần nói thêm, loại thực đo này phụ thuộc vào độ chính xác hiển thị của thước đo sử dụng, và nhà cung cấp có thể điều chỉnh cách đo ở phía sau bất cứ lúc nào. Anthropic và OpenAI đều chưa phản hồi công khai về kết luận của báo cáo.

Nguồn tham khảo: báo cáo thực đo hạn mức thuê bao của SemiAnalysis, Techmeme, CocoLoop, AI Weekly, Implicator; con số "5 lần" tính theo giá trị API quy đổi của Opus 5.5 so với GPT-6.1 Sol ở gói 200 USD, tỷ lệ năng lực tính toán và doanh thu là ước tính của SemiAnalysis.