Moonshot AI (Nguyệt Chi Ám Diện) đã phát hành K1.5 trước K2, với điểm nhấn cốt lõi là sử dụng học tăng cường thuần túy để nâng cao khả năng suy luận.
Hướng tiếp cận kỹ thuật
Việc tăng cường suy luận của K1.5 không dựa vào các phương pháp thông thường như SFT (tinh chỉnh có giám sát) hay RLHF, mà phụ thuộc nhiều hơn vào huấn luyện RL (học tăng cường) thuần túy.
Điều này tương tự như hướng tiếp cận của DeepSeek R1 – để mô hình tự học suy luận thông qua quá trình thử và sai cùng tín hiệu phần thưởng, thay vì được dạy bằng "các bước suy luận đúng" do con người gán nhãn.
Lợi ích bao gồm:
- Không bị giới hạn bởi chất lượng và số lượng dữ liệu do con người gán nhãn
- Mô hình có thể học được các chiến lược suy luận mà người gán nhãn chưa nghĩ tới
- Về mặt lý thuyết, dễ dàng mở rộng quy mô hơn
Hiệu suất
K1.5 đạt được kết quả hàng đầu trong số các mô hình mã nguồn mở cùng thời trên các benchmark suy luận toán học. Mặc dù vẫn còn khoảng cách so với các mô hình mã nguồn đóng như GPT-4o và Claude Opus, nhưng khoảng cách này nằm trong phạm vi chấp nhận được.
Quan trọng hơn, K1.5 đã xác nhận tính khả thi của phương pháp RL thuần túy trên các mô hình quy mô trung bình. Điều này đặt nền tảng kỹ thuật cho sự phát triển của K2 và K2.5 sau này.
Mối quan hệ với K2
K1.5 giống như một phiên bản tiền kỹ thuật của K2 – sau khi xác nhận hướng tiếp cận suy luận dựa trên RL, K2 đã áp dụng phương pháp luận này trên quy mô nghìn tỷ tham số, đồng thời bổ sung kiến trúc MoE để kiểm soát chi phí tính toán.
Quá trình lặp từ K1.5 lên K2 cho thấy lộ trình nghiên cứu của Moonshot AI là xác nhận phương pháp luận trước, sau đó mới mở rộng quy mô, thay vì bắt đầu với số lượng tham số lớn ngay từ đầu. Chiến lược gia tăng dần này rất thực tế đối với các nhóm có nguồn lực hạn chế.
Nguồn tham khảo: CocoLoop, Blog kỹ thuật của Moonshot AI