Kimi K2.6 Code ra mắt: Rẻ hơn Claude Sonnet 5 lần

Ngày 13 tháng 4, Moonshot AI đã phát hành bản xem trước mã K2.6 cho tất cả người đăng ký Kimi Code. Phiên bản này được triển khai rộng rãi sau khoảng một tuần thử nghiệm kín, chỉ chưa đầy hai tuần sau khi GPT-5.4-Cyber và Anthropic Mythos được phát hành.

Moonshot không tổ chức sự kiện ra mắt, không có bài blog dài. Một email, và Kimi Code của bạn đã được nâng cấp.

So với K2.5, K2.6 tập trung vào ba cải tiến: chuỗi suy luận sâu hơn, kế hoạch Agent đa bước rõ ràng hơn và thực thi gọi công cụ đáng tin cậy hơn. Hiệu quả thực tế thể hiện ở việc: khi thực hiện tái cấu trúc lớn trên nhiều tệp hoặc phân tách các quy trình Agent phức tạp, tỷ lệ lỗi giảm xuống và logic mạch lạc hơn.

Giá cả là lợi thế thực sự

Trước khi điểm chuẩn được công bố, mức giá đã gây ấn tượng mạnh.

Mô hình Đầu vào (mỗi triệu token) Đầu ra (mỗi triệu token)
Kimi K2.6 $0,60 $2,50
Claude Sonnet 4.6 $3,00 $15,00
GPT-5.4 $2,50 $10,00

Đầu vào rẻ hơn 5 lần, đầu ra rẻ hơn 6 lần. Lấy một con số cụ thể: nếu một nhóm nhỏ hoặc vừa xử lý 100 triệu token đầu vào và 10 triệu token đầu ra mỗi tháng, họ có thể tiết kiệm khoảng 4.380 đô la mỗi năm. Đối với các nhóm coi chi phí gọi API là chi phí vận hành thực tế, đây không phải là con số nhỏ.

Điểm chuẩn của K2.5 là 76,8% (SWE-Bench Verified) và 85% (LiveCodeBench) — đây đã là hàng đầu trong số các mô hình trọng số mở. Điểm chuẩn chính thức của K2.6 chưa được công bố, nhưng các nhà phát triển thử nghiệm kín thường phản hồi rằng đầu ra của K2.6 "có hương vị Opus" — chuỗi suy luận chi tiết, quá trình suy nghĩ có cấu trúc, khá giống với verbose chain-of-thought của Claude.

Agent Swarm: Song song thực sự

Thay đổi kỹ thuật đáng kể nhất của K2.6 là tái cấu trúc ở cấp độ Agent Swarm.

Agent Swarm của Kimi là cơ chế cho phép tối đa 100 sub-agent làm việc song song. K2.5 có một vấn đề cũ: Orchestrator (bộ điều phối tổng thể) về mặt lý thuyết hỗ trợ song song, nhưng trong thực tế thường suy biến thành xử lý tuần tự. K2.6 đã tối ưu hóa đặc biệt cho vấn đề này, giờ đây Orchestrator có thể thực sự duy trì thực thi song song mà không suy biến mặc định.

Kết quả là: trên các tác vụ có thể song song hóa, tốc độ tăng lên tới 4,5 lần. Nếu bạn đang chạy xử lý dữ liệu hàng loạt, kiểm thử nhiều bước, tổng hợp tìm kiếm song song, bạn sẽ cảm nhận rõ rệt.

Việc tạo mã front-end cũng trở nên đẹp hơn — không chỉ mã chạy được, mà bố cục và logic hình ảnh cũng hợp lý hơn.

Trọng số mở, có thể chạy cục bộ

K2.6 dựa trên kiến trúc MoE với hàng nghìn tỷ tham số, duy trì chiến lược trọng số mở nhất quán của Moonshot. Nếu bạn đang triển khai cục bộ nơi dữ liệu không được phép xuất khẩu, hoặc muốn chạy trên cụm suy luận của riêng mình, về mặt lý thuyết là được hỗ trợ.

Tuy nhiên, phiên bản trọng số mở đầy đủ hiện chưa được phát hành hoàn chỉnh, chủ yếu được cung cấp qua API và đăng ký Kimi Code. Trọng số mở đầy đủ dự kiến được phát hành vào khoảng tháng 5 năm 2026.

Đối với các nhóm cần chạy các Agent mã lớn trong môi trường riêng tư, thời điểm này đáng để đánh dấu.

Một số hạn chế thực tế

Thực tế là: không phải mọi thứ đều hoàn hảo.

  • CLI bị chậm vài ngày: API và giao diện web được nâng cấp lên K2.6 trước, người dùng dòng lệnh phải đợi khoảng ba ngày. Đối với nhiều nhà phát triển, CLI là cổng vào chính
  • Tên phiên bản bắt đầu lộn xộn: K2, K2.5, K2.6, K2.6-code-preview, K2.6-instruct… khó biết endpoint nào đang chạy phiên bản nào, việc ghim phiên bản trở thành gánh nặng vận hành
  • Tài liệu tiếng Anh vẫn đang theo kịp: So với Anthropic và OpenAI, chất lượng và tốc độ cập nhật tài liệu kỹ thuật tiếng Anh của Moonshot vẫn còn kém. Trải nghiệm của nhà phát triển quốc tế không tốt
  • Giới hạn tần suất gọi API: 300-1200 lần mỗi 5 giờ, không đủ cho các tác vụ hàng loạt đồng thời cao, cần tự xếp hàng

K3 vẫn đang trên đường

K2.6 đã ra mắt, nhưng các cuộc thảo luận về K3 vẫn chưa dừng lại. Tin đồn trong cộng đồng cho rằng số tham số mục tiêu của K3 sẽ vào khoảng 3-4 nghìn tỷ, ngang hàng với các mô hình hàng đầu của Mỹ. Moonshot chính thức xác nhận K3 đang được phát triển vào cuối tháng 3, nhưng không tiết lộ các tính năng cụ thể.

Cách phát hành K2.6 — một email, sau đó đẩy trực tiếp — cho thấy Moonshot đang lặp lại một cách khá kín đáo. Không tạo tin tức lớn, trước tiên hãy để người dùng cảm nhận. Điều này không mâu thuẫn với tin đồn K3 "đang chuẩn bị một điều lớn".

Đối với các nhà phát triển, tình trạng hiện tại là: bạn có thể chi trả, điểm chuẩn cũng ổn, các nhược điểm có thể chấp nhận được, thì hãy sử dụng trước. Khi K3 ra mắt, hãy đánh giá lại.

Nguồn tham khảo: Kimi Code K2.6: Key Takeaways for Developers (BuildFastWithAI); Kimi K2.6 Code Preview Is Here (kimi-k2.org); Moonshot's Kimi K2.5 is open, CocoLoop, 595GB, and built for agent swarms (VentureBeat)