Liquid AI tăng tốc giải mã 3,18 lần bằng mô hình nháp 300M

Ngày 20/8, Liquid AI đăng tải trên Hugging Face một loạt mô hình nháp LFM2.5-DSpark, trang bị giải mã suy đoán cho ba mô hình của hãng: LFM2.5-1.2B-Instruct, 2.6B và 8B-A1B. Theo công bố chính thức, mức tăng tốc cao nhất đạt 3,18 lần, kết quả đầu ra hoàn toàn giống với mô hình gốc.

Ý tưởng của giải mã suy đoán không phức tạp: để một mô hình nhỏ đoán trước vài từ tiếp theo, mô hình lớn không còn phải tính từng từ một mà đưa cả chuỗi ứng viên này vào một lượt lan truyền xuôi để xác minh hàng loạt. Đoán đúng thì dùng luôn, đoán sai mới phải tính lại. Toàn bộ thời gian tiết kiệm được là thời gian đáng lẽ phải dùng để nạp đi nạp lại trọng số.

655MB đổi lấy gấp hai, ba lần tốc độ

Các mô hình nháp mà Liquid AI trang bị lần này đều rất nhỏ. Phiên bản dành cho 1.2B có 295,7 triệu tham số, còn 2.6B và 8B-A1B dùng chung một phiên bản 327,7 triệu tham số. Cấu trúc gồm 5 lớp full attention, chiều ẩn 2048, lớp trung gian 6144, 32 đầu truy vấn chia sẻ 8 nhóm KV, mỗi lần đề xuất 9 từ ứng viên. Ở độ chính xác BF16, dung lượng VRAM chiếm dụng là 655MB.

Thử tính nhẩm trên một chiếc Mac 16GB RAM: 655MB chỉ chiếm khoảng 4% tổng bộ nhớ, nhưng đổi lại tốc độ phản hồi hội thoại cục bộ nhanh hơn gấp đôi. Tỷ lệ đánh đổi này khá đáng giá trong các kịch bản AI trên thiết bị. Thứ mà AI trên thiết bị thiếu nhất chưa bao giờ là đỉnh hiệu năng tính toán, mà là vài giây trống trải lúc chờ đợi.

Con số còn tùy chạy trên phần cứng nào

Bộ benchmark chính thức chia thành hai môi trường, kết quả chênh lệch không nhỏ.

Mô hình đíchH100 trung bìnhH100 đỉnhM4 Max trung bìnhM4 Max đỉnh
1.2B-Instruct2,10x2,56x2,54x2,87x
2.6B2,67x3,06x2,27x2,63x
8B-A1B2,54x3,18x1,18x1,44x

Con số 3,18 lần trong tiêu đề đến từ thành tích tốt nhất của 8B-A1B trên H100. Cùng mô hình đó khi chuyển sang laptop M4 Max chỉ còn 1,18 lần. Chính Liquid AI đã nêu rõ nguyên nhân: backend Metal của llama.cpp hiện triển khai cấu trúc hỗn hợp chuyên gia (MoE) chưa tốt, MoE trên thiết bị là điểm yếu của giải pháp này.

Dữ liệu tỷ lệ chấp nhận cũng được công bố cùng lúc. Trên MATH500, cứ 10 từ ứng viên của 8B-A1B thì trung bình 8,27 từ được chấp nhận; trên GSM8K con số này chỉ còn 4,02. Các văn bản chứng minh toán học có cấu trúc chặt chẽ, khả năng dự đoán cao nên mô hình nháp đoán khá chuẩn; còn với dạng đề toán tiểu học diễn đạt tùy hứng, tỷ lệ trúng lập tức giảm một nửa.

Một số liệu khác gần với ứng dụng thực tế hơn: trong kịch bản gọi hàm đa công cụ, độ trễ của phiên bản 2.6B giảm trung bình 57%. Mỗi bước của agent đều phải chờ mô hình xuất ra lệnh gọi có cấu trúc, dạng qua lại này sợ nhất là độ trễ cộng dồn.

Phương pháp này đến từ đâu

Cái tên DSpark không phải do Liquid AI đặt ra. Nó xuất phát từ một công trình mã nguồn mở do DeepSeek và Đại học Bắc Kinh phối hợp công bố vào cuối tháng 6 năm nay, sử dụng khung xương nháp song song kết hợp đầu Markov nhẹ, cộng thêm cơ chế điều phối độ dài xác minh theo tải GPU thời gian thực. Số liệu công bố khi đó cho thấy tốc độ sinh văn bản cho một người dùng tăng 60% đến 85%, còn dưới mục tiêu độ trễ nghiêm ngặt, thông lượng trên một card có thể tăng tối đa 6,6 lần.

Hai tháng sau, phương pháp này xuất hiện trong bản phát hành của một công ty mô hình AI trên thiết bị của Mỹ. Cách kích hoạt trên SGLang là thêm tham số --speculative-algorithm DSPARK, còn llama.cpp hỗ trợ ngay từ ngày đầu định dạng FP16 GGUF trên backend Metal. Việc các framework thượng nguồn đưa tên thuật toán thành giá trị công tắc trong dòng lệnh, tự nó đã cho thấy phương pháp này được xem như một chuẩn mực nghiễm nhiên.

Hai năm qua, các phòng thí nghiệm Trung Quốc đã mã nguồn mở khá nhiều thành quả kỹ thuật ở khâu suy luận, phần lớn thảo luận xoay quanh việc có tiết kiệm được card hay không. Lần lan tỏa này của DSpark mang lại một kiểu lợi ích khác: phương pháp đã lọt vào lộ trình mặc định của người khác, mọi triển khai sau này dựa trên framework đó đều đang chạy theo tư duy của chính mình.

Giấy phép vạch ra một ranh giới

Trọng số được phát hành ở hai định dạng Safetensors và GGUF, theo Giấy phép Mở LFM 1.0: các tổ chức có doanh thu năm dưới 10 triệu USD được dùng thương mại miễn phí, vượt ngưỡng này phải đàm phán riêng thỏa thuận thương mại. Cách triển khai duy nhất là tự lưu trữ (self-hosted), Liquid AI không cung cấp API dạng dịch vụ lưu trữ.

Ranh giới này nằm giữa các công ty khởi nghiệp và doanh nghiệp cỡ vừa, lớn, mục đích khá rõ ràng — dùng hạn mức miễn phí để đổi lấy lựa chọn mặc định của nhà phát triển, còn nguồn thu thì để dành cho nhóm có khả năng chi trả.

Nguồn tham khảo: Hugging Face, thẻ mô hình của Liquid AI, CocoLoop, MarkTechPost; số liệu về mức tăng tốc, số lượng tham số và tỷ lệ chấp nhận lấy theo bảng benchmark chính thức, điều khoản giấy phép lấy theo trang mô hình.