Một công cụ suy luận mã nguồn mở tên là Colibrì gần đây đã vượt mốc hơn 37.000 sao và hơn 4.000 lượt fork trên GitHub. Mục tiêu của nó rất rõ ràng: giúp các mô hình lớn kiểu MoE với vài trăm tỷ đến hơn một nghìn tỷ tham số chạy được trên máy tính của người dùng thông thường. Với GLM-5.2 của Zhipu, dự án đưa ra cấu hình tối thiểu là 16GB RAM, khuyến nghị 24GB, còn card đồ họa là không bắt buộc.
Dự án được Vincenzo Fornaro khởi tạo ngày 1/7, viết hoàn toàn bằng C, không phụ thuộc thư viện ngoài khi chạy, cấp phép theo Apache 2.0. Phiên bản 1.12.0 phát hành ngày 20/9 đã gộp 81 pull request; phiên bản 1.12.1 ngày 24/9 gộp thêm 96 cái nữa, trong đó 80 đến từ những người đóng góp bên ngoài.
Trọng số nằm trên ổ đĩa, cần lớp nào đọc lớp đó
Đặc điểm của mô hình MoE là tổng số tham số rất lớn nhưng mỗi token thực tế chỉ dùng đến một phần nhỏ. GLM-5.2 có tổng cộng 744 tỷ tham số, nhưng mỗi lượt chỉ kích hoạt khoảng 40 tỷ. Cách tiếp cận của Colibrì là không nạp toàn bộ mô hình vào RAM: toàn bộ trọng số, sau khi lượng tử hóa int4, được lưu trên ổ SSD NVMe — khoảng 372GB với GLM-5.2 và 419GB với GLM-5.3.
Dự án coi VRAM, RAM và SSD như một hệ lưu trữ thống nhất ba tầng, mà tác giả gọi là "biên dịch trọng số theo thời gian thực". Cụ thể gồm: bộ đệm LRU riêng cho từng lớp, giữ cố định trong bộ nhớ những chuyên gia (expert) được dùng nhiều, tải trước một lớp các chuyên gia có khả năng cần đến ở lớp kế tiếp, gộp các chuyên gia mà nhiều token cùng cần vào một lượt đọc, cho việc đọc đĩa chồng lấn với tính toán, và hỗ trợ đọc song song theo kiểu striping trên hai ổ SSD.
README của dự án nói rõ về sự đánh đổi tốc độ: nếu bộ nhớ tốc độ cao không đủ thì hệ thống chỉ chậm đi, không làm giảm độ chính xác của mô hình. Còn về tốc độ, dự án "không đưa ra bất kỳ cam kết nào".
Tốc độ thực tế nhanh đến đâu
Dự án đưa ra một số mức đo thực tế:
- 6 card RTX 5090, toàn bộ trọng số nằm sẵn trong bộ nhớ: 5,8 đến 6,8 token mỗi giây
- Máy bàn chỉ dùng CPU với 128GB RAM, sau khi bộ đệm đã "ấm": khoảng 1,8 token mỗi giây
- Một card RTX 5070 Ti: 1,07 token mỗi giây
- Máy phát triển của tác giả với 25GB RAM, khởi động nguội: 0,05 đến 0,1 token mỗi giây
Phiên bản 1.11.0 giữa tháng 9 bổ sung DeepSeek V4.1 Flash, 552 tỷ tham số, chiếm 510GB ổ đĩa, chạy trên máy chỉ dùng CPU và đọc thẳng trọng số gốc mà không cần chuyển đổi định dạng. Theo ghi nhận của tác giả, độ trễ khởi động nguội cho một lượt hỏi đáp giảm từ 78,7 giây xuống còn 25,1 giây, và trong năm lượt hội thoại liên tiếp, tốc độ ổn định ở mức 1,14 đến 1,58 token mỗi giây.
Tính năng mới chính của bản 1.12.0 gọi là chế độ brio: bên gọi đưa ra một tập hợp giới hạn các phương án trả lời, và công cụ chỉ đọc thẳng xác suất của từng phương án, không sinh văn bản qua lấy mẫu — số token đầu ra bằng 0, và câu trả lời không thể nằm ngoài các phương án đã cho. Với phần lớn người dùng chạy cục bộ, cách này thực dụng hơn nhiều so với việc chờ trả lời từng chữ một.
Danh sách mô hình hỗ trợ gần như là một bảng liệt kê các mô hình mở của Trung Quốc
Colibrì hiện hỗ trợ chín họ mô hình: GLM-5.2/5.3 cùng phiên bản có thị giác GLM-5.3-Flash, DeepSeek V4 Flash và V4.1 Flash, Kimi K3, Qwen3.6 và Qwen3.8-Flash-Next, cùng với Inkling và OLMoE. Ngoài hai cái sau, tất cả đều đến từ các công ty Trung Quốc gồm Zhipu, DeepSeek, Moonshot AI và Alibaba.
Đối với các nhà phát triển tại Trung Quốc, điều này có hai lợi ích. Thứ nhất là dữ liệu không rời khỏi máy: những nơi như văn phòng luật, bệnh viện, nhà máy sản xuất không thể đưa tài liệu lên đám mây, chỉ cần một trạm làm việc 128GB RAM cộng một ổ SSD 1TB là đã có thể chạy cục bộ một mô hình GLM 744 tỷ tham số. Thứ hai là hạ thấp ngưỡng gia nhập: với một mô hình như Kimi K3 có 2,8 nghìn tỷ tham số, trọng số int4 chiếm khoảng 1,6TB, yêu cầu tối thiểu 32GB RAM, trước đây gần như không thể để một cá nhân tự chạy được mô hình này trên máy riêng.
Giới hạn cũng rõ ràng không kém. Với tốc độ một đến hai token mỗi giây, viết một câu trả lời dài nghìn chữ phải chờ hơn mười phút; tài liệu dự án không đưa ra ước tính về mức hao mòn của ổ SSD khi phải đọc ngẫu nhiên cường độ cao trong thời gian dài. Bản thân tác giả cũng lưu ý rằng hiệu quả tăng tốc từ giải mã suy đoán (speculative decoding) là số liệu đo thực tế, chuyển sang máy khác chưa chắc đã lặp lại được.
Nguồn tham khảo: README dự án Colibrì, ghi chú phát hành Colibrì từ bản 1.11 đến 1.12.1, QbitAI, CocoLoop; các số liệu tốc độ theo đúng cấu hình thử nghiệm mà dự án công bố, số liệu sao lấy từ trang GitHub.