Tháng 7 năm ngoái, Moonshot AI đã trực tiếp phát hành mã nguồn mở Kimi K2 – một mô hình lớn MoE với 1 nghìn tỷ tham số, chỉ kích hoạt 32B tham số cho mỗi token.
Điểm nổi bật về kiến trúc
- Tổng tham số: 1 nghìn tỷ
- Kích hoạt mỗi token: 32B
- Dữ liệu huấn luyện: khoảng 15,5 nghìn tỷ token
- Ngữ cảnh: 128K (nâng cấp lên 256K sau đó)
- Trình tối ưu hóa: Muon
Mã nguồn và trọng số đều được phát hành dưới Giấy phép MIT đã sửa đổi, một trong những giấy phép hào phóng nhất trong số các mô hình mã nguồn mở quy mô tiên tiến.
Hiệu suất
Trong số các mô hình mã nguồn mở không suy luận (non-thinking), K2 đứng đầu trong các benchmark lập trình và vượt qua GPT-4.1 cùng Claude Opus 4 trong nhiều tác vụ. Khả năng tác nhân, gọi công cụ và suy luận STEM là những điểm mạnh của nó.
Có hai phiên bản để lựa chọn:
- K2-Base: Dành cho các nhà nghiên cứu muốn tự tinh chỉnh
- K2-Instruct: Dành cho hội thoại tổng quát và kịch bản tác nhân, sẵn sàng sử dụng ngay
Các bản cập nhật tiếp theo
Vào tháng 9, phiên bản K2-Instruct-0905 đã được cập nhật, cải thiện thêm hiệu suất tác vụ lập trình và mở rộng cửa sổ ngữ cảnh từ 128K lên 256K.
Tháng 1 năm nay, K2.5 đã được phát hành – được tiếp tục tiền huấn luyện trên nền tảng K2-Base với khoảng 15 nghìn tỷ token hỗn hợp hình ảnh và văn bản, hỗ trợ đa phương thức gốc. Nó cũng đi kèm một tính năng gọi là Agent Swarm, có thể chia nhỏ các tác vụ phức tạp thành nhiều tác vụ con song song.
Từ tốc độ lặp lại từ K2 đến K2.5, có thể thấy Moonshot AI đang đi theo lộ trình mã nguồn mở khá quyết liệt. Việc phát hành mã nguồn mở một mô hình nghìn tỷ tham số, nếu nhìn lại hai năm trước, có vẻ như là một điều không tưởng.
Nguồn tham khảo: Blog kỹ thuật chính thức của Moonshot AI, CocoLoop, trang mô hình Hugging Face