Mô hình mới của DeepSeek bắt kịp Astra về code, chi phí chênh 15 lần

Fireworks AI vừa công bố một loạt dữ liệu đánh giá cho DeepSeek-V4.1-Flash, và kết luận có thể tóm trong một câu: trên các tác vụ lập trình dạng agent, mô hình này rơi vào cùng dải độ chính xác với GPT-6 Astra, trong khi chi phí mỗi tác vụ chênh nhau tới 15 lần.

Trước hết là điểm số. Ở chỉ số pass@1 của DeepSWE, DeepSeek-V4.1-Flash đạt 74,34%, GPT-6 Astra đạt 74,12%, Gemini 3.8 Flash đạt 73,83%, Claude Opus 5 đạt 73,65%. Bốn mô hình chen nhau trong khoảng cách chỉ 0,69 điểm phần trăm, việc ai đứng đầu gần như không còn nhiều ý nghĩa phân biệt. Trên Terminal-Bench 2.1, DeepSeek đạt 86,5%, Astra đạt 87,5%, nhỉnh hơn một chút.

Bài toán chi phí

Theo số liệu Fireworks đưa ra, chi phí mỗi tác vụ lần lượt là: DeepSeek-V4.1-Flash 0,430 USD, Gemini 3.8 Flash 2,362 USD, GPT-6 Astra 6,524 USD, Claude Opus 5 11,838 USD. Lấy DeepSeek làm mốc, ba mô hình còn lại đắt hơn lần lượt 5,5 lần, 15 lần và 28 lần.

Thử tính xem mức chênh lệch này nặng đến đâu trong ngân sách thực tế: một đội kỹ sư 10 người, mỗi người chạy 20 tác vụ lập trình agent mỗi ngày, tính theo 22 ngày làm việc một tháng thì tổng cộng 4.400 tác vụ. Đi theo hướng DeepSeek tốn khoảng 1.892 USD, đi theo hướng Astra tốn khoảng 28.706 USD, chênh nhau khoảng 26.800 USD một tháng, và khoảng 320.000 USD một năm. Đây chỉ là ước tính, phân bố token của tác vụ thực tế sẽ không hoàn toàn giống bộ đánh giá, nhưng mức độ lớn nhỏ thì tương đương.

Khoảng cách trên HLE

Cũng trong bộ dữ liệu này có một khoảng cách theo chiều ngược lại. Ở bài kiểm tra Humanity's Last Exam, DeepSeek-V4.1-Flash đạt 34,52%, GPT-6 Astra đạt 50,40%, chênh tới 15,88 điểm phần trăm. Việc bắt kịp trên các tác vụ lập trình không lan sang được nhóm bài suy luận tổng hợp khó này.

Fireworks tiện thể đưa ra thêm một chỉ số Oracle Router: nếu kết hợp hai mô hình lại, điểm lý thuyết đạt được là 54,80%. Đây là mức trần, với điều kiện mỗi câu hỏi đều được xác định trước nên giao cho mô hình nào. Hệ thống định tuyến thực tế không có được con số này, nó giống một cách nói rằng điểm mù năng lực của hai mô hình không trùng nhau, hơn là một giải pháp có thể triển khai.

Về mặt kiến trúc

Bản thân mô hình là một MoE 552 tỷ tham số, với việc kích hoạt được tách riêng cho đầu vào và đầu ra: phía đầu vào kích hoạt 8 tỷ, phía đầu ra kích hoạt 16 tỷ. Thay đổi ở KV cache trực tiếp hơn: dung lượng HBM sử dụng giảm còn một phần tư so với thế hệ trước, dung lượng SSD giảm còn một phần tám.

Nguồn gốc của lợi thế chi phí khớp với lớp kiến trúc này. Đặc điểm của tác vụ lập trình dạng agent là ngữ cảnh dài, nhiều lượt, nên chi phí KV cache chiếm tỷ trọng cao hơn nhiều so với hỏi đáp một lần. Khi nén dung lượng bộ nhớ và ổ đĩa của cache xuống còn một phần tư và một phần tám, bên cung cấp dịch vụ có thể nhồi thêm nhiều yêu cầu đồng thời trên cùng phần cứng, nhờ đó giá mỗi tác vụ mới hạ xuống được. Con số 0,43 USD không phải chỉ đến từ chiến lược định giá đơn thuần.

Nguồn gốc của những con số này

Cần nói rõ, bộ đánh giá này do chính Fireworks AI công bố, trong khi DeepSeek-V4.1-Flash đang được bán trên nền tảng của họ — bên đánh giá và bên bán hàng là một. Phía DeepSeek chưa xác nhận những con số này, và hiện cũng chưa thấy bên thứ ba độc lập nào tái lập được kết quả.

Việc chọn bộ benchmark cũng ảnh hưởng đến kết luận. DeepSWE và Terminal-Bench đều thiên về các tác vụ code mang tính kỹ thuật, có độ trùng khớp khá tốt với công việc phát triển hàng ngày, nhưng nếu đổi sang bộ chuẩn khác, đổi sang phân bố tác vụ khác, liệu vị trí tương đối của bốn mô hình có còn giữ trong khoảng 0,69 điểm phần trăm hay không thì bộ dữ liệu này không trả lời được. Nhìn vào tỷ lệ chênh lệch chi phí thì được, nhưng coi đây là thứ hạng năng lực cuối cùng của các mô hình thì không nên.

Nguồn tham khảo: blog kỹ thuật Fireworks AI, CocoLoop; ba chỉ số DeepSWE, Terminal-Bench 2.1, HLE cùng chi phí mỗi tác vụ và thông số kiến trúc mô hình được đối chiếu từng mục với bài blog gốc, mức chi tiêu hàng tháng của đội 10 người là ước tính sơ bộ.