Liquid AI tăng tốc giải mã 3,18 lần bằng mô hình nháp 300M
Liquid AI ra mắt mô hình nháp LFM2.5-DSpark, tăng tốc suy luận cục bộ tới 3,18 lần bằng giải mã suy đoán, kế thừa phương pháp của DeepSeek và Đại học Bắc Kinh.
11 bài đã kiểm chứng về suy luận AI, sản phẩm và diễn biến ngành.
Liquid AI ra mắt mô hình nháp LFM2.5-DSpark, tăng tốc suy luận cục bộ tới 3,18 lần bằng giải mã suy đoán, kế thừa phương pháp của DeepSeek và Đại học Bắc Kinh.
Tencent Hunyuan công bố AngelSpec, khung mở để huấn luyện drafter speculative decoding và giảm chi phí suy luận mô hình lớn.
DeepSeek và Đại học Bắc Kinh mã nguồn mở DSpark, khung suy luận giúp tăng tốc tạo văn bản 60% đến 85% và nâng thông lượng một GPU tối đa 6,6 lần.
Xiaomi MiMo tuyên bố đạt 1.000 token/giây trên GPU phổ thông. Bài viết tóm tắt thông báo, bối cảnh chiến lược và rủi ro thực tế với người dùng hoặc doanh nghiệp liên quan.
Tensormesh huy động 20 triệu USD từ AMD Ventures, NVentures, CoreWeave và các nhà đầu tư khác để thương mại hóa nền tảng KV cache, giảm lãng phí GPU trong suy luận AI.
MiniMax công bố dòng mô hình suy luận M1, tập trung vào toán học, lập trình và phân tích logic, với phiên bản cải tiến M2.5 đạt 80,2% trên SWE-bench Verified, xếp hạng cao trong nhóm dẫn đầu toàn cầu.
Bài viết so sánh các mô hình suy luận hàng đầu từ OpenAI, DeepSeek, Google và Anthropic, phân tích chiến lược, sự đánh đổi giữa độ sâu suy luận và tốc độ phản hồi, cũng như cuộc cạnh tranh giữa mã nguồn mở và mã nguồn đóng.
GPT-5.2 đạt 72% trên ARC-AGI-1 và 18% trên ARC-AGI-2, cho thấy khoảng cách giữa AI thông minh bề ngoài và trí thông minh tổng quát thực sự.
DeepSeek đã mở mã nguồn mô hình suy luận R1 vào tháng 1 năm 2026, gây bất ngờ khi hiệu suất của nó ngang ngửa OpenAI o1, trong khi phiên bản cô đọng 32B thậm chí vượt qua o1-mini, phá vỡ rào cản về giá của các mô hình đóng.
Google công bố Gemini 2.5 Pro, mô hình AI được cho là thông minh nhất từ trước đến nay, với điểm số ấn tượng trong các bài kiểm tra toán, khoa học và lập trình, cùng khả năng xử lý ngữ cảnh lên tới 1 triệu token.
Anthropic phát hành Opus 4.6 với tính năng Adaptive Thinking, cho phép mô hình tự động đánh giá độ khó và điều chỉnh độ sâu suy luận, kèm cửa sổ ngữ cảnh 1 triệu token và cải thiện hiệu suất trong các tác vụ agent.