Nhà cung cấp dịch vụ suy luận Fireworks AI vừa ra mắt Ember-1, xây trên nền mô hình trọng số mở Kimi K3 của Moonshot AI. Fireworks không thay đổi kiến trúc mô hình mà chỉ thực hiện hậu huấn luyện (post-training), với mục tiêu duy nhất: để K3 "suy nghĩ" ít hơn nhưng trả lời chất lượng tương đương. Theo công bố chính thức, số token sinh ra giảm khoảng 40% trong khi chất lượng gần như không đổi.
Hiện tại Ember-1 chỉ có dưới dạng bản xem trước nghiên cứu (research preview) trên Fireworks Serverless, chỉ truy cập qua API, không công bố trọng số hay mã huấn luyện và không thể tự lưu trữ (self-host). Mức giá giữ nguyên như K3 trên Fireworks: 3 USD cho mỗi triệu token đầu vào, 0,30 USD cho token đầu vào có cache, và 15 USD cho token đầu ra.
Phần tiết kiệm chủ yếu nằm ở "suy nghĩ"
Fireworks giải thích động cơ trong bài blog: người dùng thích khả năng viết code của K3, nhưng chuỗi suy luận của nó quá dài, khiến chi phí khó giảm khi đưa vào quy trình lập trình tự động. Theo thống kê của họ, với các mô hình suy luận như K3, đôi khi hơn 90% đầu ra dành cho quá trình suy luận nội bộ trước khi đưa ra câu trả lời; khi agent gọi công cụ (tool) từng bước, mô hình còn "nghĩ lại" những gì đã nghĩ trước đó ở mỗi bước.
Cách trực tiếp nhất là hạ mức reasoning effort của K3, nhưng Fireworks cho biết đã thử và chất lượng giảm quá nhiều ở mức thấp. Ember-1 đi theo hướng khác, nguyên văn từ phía công ty:
"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."
Ember-1 là K3 được hậu huấn luyện để suy luận bằng ít token hơn, chứ không phải chạy ở mức effort thấp hơn.
Quá trình huấn luyện bao phủ toán học, viết code, tuân theo chỉ dẫn, hội thoại, tìm kiếm, gọi công cụ và kỹ thuật phần mềm, với hơn 50 thử nghiệm huấn luyện và hơn 200 lần đánh giá, tất cả chạy trên hạ tầng Serverless Training riêng và dùng dữ liệu độc quyền. Về thuật toán cụ thể, Fireworks nói đây là phương pháp mới, chưa công bố, nên bên ngoài hiện chưa thể tái hiện.
Điểm benchmark: có tăng có giảm
Fireworks đã so sánh Ember-1 với ba mức của K3:
| Benchmark | K3 thấp | K3 cao | K3 Max | Ember-1 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 76,4% | 77,6% | 80,9% | 82,0% |
| SWE-bench Verified | 80,4% | 86,0% | 93,2% | 92,2% |
| DeepSWE 1.1 | 55,8% | 62,8% | 66,4% | 75,2% |
Trên DeepSWE, Ember-1 vượt K3 Max gần 9 điểm phần trăm, nhưng trên SWE-bench Verified lại thấp hơn 1 điểm. Theo dữ liệu được truyền thông bên thứ ba trích dẫn, trên SWE-Interact, Ember-1 cũng thấp hơn K3 Max một chút. Tất cả đều là kết quả tự kiểm tra của Fireworks, hiện chưa có tổ chức đánh giá độc lập nào xác nhận lại.
Thuyết phục hơn là dữ liệu thực tế trực tuyến. Fireworks đã cùng hai khách hàng thực hiện thử nghiệm A/B trên lưu lượng lập trình thật, tổng thể số token mỗi tác vụ giảm khoảng 35%. Trong đó một bộ số liệu đầy đủ nhất cho thấy: token suy luận giảm 71,3%, tổng token giảm 39%, điểm tác vụ 0,753 so với 0,751. Một khách hàng đã chuyển Ember-1 vào môi trường sản xuất, tên công ty chưa được công bố.
Nhẩm tính một khoản chi phí
Vì đơn giá như nhau nên khoản tiết kiệm hoàn toàn đến từ việc sinh ít token hơn. Theo ước tính từ bộ dữ liệu A/B nói trên, chi phí đầu ra mỗi tác vụ của K3 Max khoảng 0,74 USD, còn Ember-1 khoảng 0,45 USD. Với một đội chạy 10.000 tác vụ lập trình mỗi ngày, chi phí đầu ra ước tính giảm từ khoảng 7.400 USD xuống còn khoảng 4.500 USD mỗi ngày, chênh lệch hơn 80.000 USD mỗi tháng. Con số này chỉ tính phần đầu ra, chưa tính đầu vào và cache, mức tiết kiệm thực tế còn tùy độ dài tác vụ.
Đối với các nhà phát triển tại Trung Quốc, ý nghĩa của Ember-1 nằm nhiều hơn ở phương pháp. K3 là mô hình trọng số mở, ai cũng có thể lấy để hậu huấn luyện, và Fireworks đã chứng minh rằng việc "nén độ dài suy luận" có thể trở thành một sản phẩm bán riêng. Các nhà cung cấp dịch vụ suy luận tại Trung Quốc cũng đang nắm trong tay những mô hình mở như K3, DeepSeek, Qwen, nên việc liệu có xuất hiện các "phiên bản tiết kiệm token" tương tự hay không là điều đáng theo dõi. Bản thân Ember-1 khi gọi từ Trung Quốc phải đi qua API ở nước ngoài, nên độ trễ và vấn đề tuân thủ cần được tự đánh giá.
Nguồn tham khảo: blog chính thức của Fireworks AI, MarkTechPost, CocoLoop, trang mô hình của Fireworks; các nội dung được kiểm chứng gồm ba điểm benchmark, dữ liệu token và điểm số thử nghiệm A/B, giá token đầu vào/đầu ra trên mỗi triệu token.