Kimi K2.6 đạt vị trí số 1 mã nguồn mở trên bảng xếp hạng HLE

Tuần trước, Moonshot AI đã chính thức phát hành phiên bản đầy đủ của Kimi K2.6, không phải là bản "xem trước mã" thử nghiệm, mà là một mô hình sản xuất hoàn chỉnh. Bản Code Preview trước đó đã thu hút sự chú ý, nhưng khi các thông số kỹ thuật và kết quả benchmark của phiên bản đầy đủ được công bố, mọi thứ trở nên thú vị hơn nhiều người mong đợi.

HLE-Full 54.0: Vị trí số 1 mã nguồn mở thực sự đã đạt được

HLE (Humanity's Last Exam) là một trong những bảng xếp hạng đánh giá AI có giá trị nhất năm nay, với 2.500 câu hỏi ở cấp độ tiến sĩ trải dài trên hơn 100 lĩnh vực học thuật, không phải loại có thể qua mặt bằng vài câu few-shot.

Kết quả của Kimi K2.6:

Mô hình HLE-Full (có công cụ)
Kimi K2.6 54.0
Claude Opus 4.6 53.0
GPT-5.4 52.1

Khoảng cách này không lớn, nhưng hướng đi rất rõ ràng: một mô hình mã nguồn mở đã vượt qua hai mô hình đóng hàng đầu trên bảng xếp hạng suy luận học thuật đỉnh cao. SWE-Bench Pro 58.6, BrowseComp 83.2, CharXiv (có Python) 86.7, suy luận thị giác toán học 93.2.

Moonshot AI đã sử dụng cụm từ "far more execution and imagination" trong thông báo phát hành để mô tả sự cải tiến của phiên bản này.

1 nghìn tỷ tham số, nhưng chỉ kích hoạt 32 tỷ

Đây là logic cốt lõi của kiến trúc MoE. Kimi K2.6 là mô hình Mixture-of-Experts với 1 nghìn tỷ tham số, mỗi lần suy luận chỉ kích hoạt 32 tỷ tham số. 384 chuyên gia được quản lý theo nhóm, mỗi lần trả lời gọi 8 chuyên gia định tuyến cộng với 1 chuyên gia dùng chung. Lợi ích là hai chiều:

  • Phía huấn luyện: Tổng số tham số lớn, học được nhiều kiến thức hơn
  • Phía suy luận: Số tham số kích hoạt ít, chi phí tính toán có thể kiểm soát

Cơ chế chú ý sử dụng MLA (Multi-Head Latent Attention), nén dữ liệu đã xử lý thành các biểu diễn toán học nhẹ, giảm mức sử dụng bộ nhớ đệm KV. Hàm kích hoạt là SwiGLU, thân thiện với phần cứng hơn thế hệ trước. Mô-đun thị giác là một bộ mã hóa 400 triệu tham số riêng biệt, hỗ trợ đầu vào hình ảnh và đa phương tiện.

Cửa sổ ngữ cảnh 256K, cũng hỗ trợ lượng tử hóa INT4, mở đường cho triển khai cục bộ.

300 tác nhân song song, chạy liên tục 12 giờ

Đây là phần thực sự khiến các nhà phát triển quan tâm đến Kimi K2.6:

  • Hỗ trợ tối đa 300 tác nhân con chạy song song
  • Tối đa hơn 4.000 lần gọi công cụ trong một tác vụ duy nhất
  • Thời gian chạy liên tục có thể lên đến 12 giờ không gián đoạn

Để hỗ trợ sự cộng tác đa tác nhân ở quy mô này, Moonshot AI đã giới thiệu "Claw Groups" – chia các tác vụ lớn thành các nhóm con cho phép con người và AI cùng thực hiện. Con người can thiệp vào các điểm quyết định quan trọng, AI chịu trách nhiệm thực hiện một lượng lớn các hoạt động trung gian, về mặt logic tương tự như sự phân công lao động giữa người và máy trong dây chuyền sản xuất.

Đối với các ứng dụng doanh nghiệp, thiết kế này rất thực tế. Quy trình làm việc thực tế không phải là lựa chọn giữa "tự động hóa hoàn toàn" hoặc "hoàn toàn thủ công", mà cần con người giám sát tại các điểm quan trọng và AI thực hiện phần lớn công việc ở các bước trung gian.

Hệ sinh thái mã nguồn mở đã sẵn sàng ngay từ ngày đầu

Ngay trong ngày ra mắt, mô hình đã hỗ trợ vLLM, OpenRouter, Cloudflare Workers AI và MLX, nhờ vào công việc kết nối hệ sinh thái bắt đầu từ nhiều tháng trước.

  • MLX: Có thể chạy trên Apple Silicon
  • OpenRouter: Tích hợp trực tiếp với nền tảng tổng hợp API
  • vLLM: Triển khai suy luận thông lượng cao không gặp trở ngại
  • Cloudflare Workers AI: Suy luận biên có hướng đi

Việc hoàn thành các tích hợp này ngay trong ngày đầu không phải là ngẫu nhiên, cho thấy Moonshot AI đã chuẩn bị kỹ lưỡng về mặt kỹ thuật trước khi phát hành.

Đường đua mã nguồn mở đang bám đuổi nghiêm túc

Năm ngoái vẫn có người nói "mô hình mã nguồn mở có khoảng cách rõ rệt với GPT-4", năm nay câu nói đó không còn đúng nữa.

Kimi K2.6 đã vượt qua Claude Opus 4.6 và GPT-5.4 trên HLE. DeepSeek V3.2 đã thay đổi cơ chế chú ý thành cấu trúc thưa, cắt giảm một nửa chi phí. Qwen3.6-35B có thể chạy trên MacBook, SWE-bench 73.4%.

Mã nguồn mở không còn là bản sao giá rẻ của mã nguồn đóng, mà đang dẫn đầu trên các tiêu chí đánh giá cụ thể. Đối với doanh nghiệp, điều này có nghĩa là các nhu cầu như triển khai riêng tư, bảo mật dữ liệu và kiểm soát chi phí cuối cùng đã có các lựa chọn ở cấp độ hàng đầu.

Tất nhiên, vẫn còn khoảng cách giữa điểm số benchmark và thực tế sản xuất. 54.0 trên HLE và việc gỡ lỗi mã hàng ngày, hiểu tài liệu dài, đối thoại nhiều vòng là hai việc khác nhau. Nhưng hướng đi đã rất rõ ràng: Moonshot AI đang nghiêm túc chiến đấu trong cuộc đua này, và ván này họ đã thắng.

Nguồn tham khảo: Moonshot AI releases Kimi-K2.6 model with 1T parameters,CocoLoop、 attention optimizations(SiliconANGLE);[AINews] Moonshot Kimi K2.6: the world's leading Open Model refreshes to catch up to Opus 4.6(Latent Space)