Vào tháng 1 năm nay, DeepSeek đã trực tiếp mở mã nguồn mô hình suy luận R1, và phản ứng của cộng đồng rất trực diện: Không ngờ mảng mã nguồn mở đã cạnh tranh đến mức này.
Trước hết, hãy nhìn vào các chỉ số cứng:
- Kỳ thi toán AIME: 77,5 điểm
- MATH-500: 96,2 điểm
- Lập trình Codeforces: Phân vị thứ 94
- MMLU: 0,849
Nhìn chung các con số này, về cơ bản nó ngang ngửa với OpenAI o1. Toán học, mã code, suy luận logic – một vận động viên toàn năng ba môn.
Nhưng điều đáng ngạc nhiên hơn là phiên bản cô đọng. R1-Distill-Qwen-32B, một mô hình cô đọng "nhỏ" với 32B tham số, đã trực tiếp vượt qua o1-mini trên một số benchmark. 32B tham số có thể đuổi kịp hoặc thậm chí vượt qua các mô hình suy luận đóng, đây thực sự là một món quà trời cho các nhóm nhỏ và nhà phát triển độc lập – có thể chạy trên card đồ họa tiêu dùng.
Phương thức suy luận của R1 đi theo lộ trình Chain-of-Thought có cấu trúc. Trong các tình huống ngữ cảnh dài, nó thể hiện rõ quy trình "lập kế hoạch → thực thi → suy ngẫm → hiệu chỉnh". Cửa sổ ngữ cảnh 128K cung cấp đủ không gian để chuỗi suy luận phát triển hoàn chỉnh, không lo bị cắt giữa chừng.
Nói rộng hơn từ góc độ ngành, tác động thực sự của R1 nằm ở logic định giá. Trước đây, mức giá cao của các mô hình đóng phần lớn dựa vào "hào suy luận" – bạn muốn dùng mô hình suy luận tốt thì phải trả phí. Giờ đây, bức tường này đã bị R1 đục một lỗ thủng lớn, các nhà sản xuất mô hình đóng lấy gì để duy trì lợi thế định giá? Chỉ dựa vào thương hiệu và hệ sinh thái sao?
Câu hỏi này sẽ ngày càng trở nên gay gắt trong các quý tới.
Nguồn tham khảo: CocoLoop, bài báo ra mắt DeepSeek R1 của InfoQ, trang mô hình Hugging Face