Google vừa ra mắt Gemini 3.1 Flash-Lite, và điểm nhấn chính chỉ gói gọn trong một từ: rẻ.
Mỗi triệu token đầu vào có giá chỉ 0,25 USD, token đầu ra là 1,5 USD. So với Gemini 3.1 Pro có giá 2 USD cho mỗi triệu token đầu vào và 18 USD cho đầu ra, mức giá này chỉ bằng khoảng một phần tám.
Đây là mô hình Gemini rẻ nhất từ trước đến nay của Google.
Tốc độ và giá cả đều thay đổi
Flash-Lite ra mắt dưới dạng bản xem trước (Preview) vào ngày 3 tháng 3, hiện có sẵn trên Google AI Studio và Vertex AI. Mô hình này được định vị cho các tình huống yêu cầu đồng thời cao và chi phí thấp – những ứng dụng cần xử lý hàng trăm nghìn yêu cầu mỗi ngày.
Một vài con số hiệu năng đáng chú ý:
- Tốc độ sinh: nhanh hơn 45% so với Gemini 2.5 Flash
- Độ trễ token đầu tiên: giảm 2,5 lần
- Thông lượng: khoảng 207 token/giây
- GPQA Diamond (chuẩn suy luận khoa học): 86,9%, cao hơn khoảng 14 điểm phần trăm so với 2.5 Flash Lite
Điểm GPQA này khá ấn tượng. Cần biết rằng 86,9% đã cao hơn nhiều mô hình "flagship", và với mức giá này, con số đó thực sự tạo nên sức hút.
Tuy nhiên, cần nói rõ: trên chuẩn suy luận khó hơn là HLA, Flash-Lite chỉ đạt 16%, trong khi 3.1 Pro đạt tới 44,4%. Các tác vụ suy luận cao cấp vẫn kém hơn rõ rệt một bậc.
Công nghệ nền tảng và kiến trúc
Flash-Lite được xây dựng trên kiến trúc MoE (Hỗn hợp chuyên gia) dựa trên nền tảng Gemini 3 Pro, hỗ trợ:
- Cửa sổ ngữ cảnh: 1 triệu token
- Phương thức đầu vào: hỗ trợ văn bản, hình ảnh, âm thanh và video
- Độ dài đầu ra: tối đa 64K token
Kiến trúc MoE là chìa khóa giúp mô hình này đạt được hiệu năng như vậy với mức giá thấp – số lượng tham số được kích hoạt ít, chi phí suy luận cho mỗi lần thấp. Đây cũng là hướng đi tương tự như DeepSeek V3 và Qwen3.
Phù hợp cho những tác vụ nào
Google đưa ra các tình huống ứng dụng rất thực tế cho mô hình này:
- Kiểm duyệt nội dung: chạy hàng loạt để phát hiện vi phạm
- Trích xuất dữ liệu: lấy thông tin từ văn bản phi cấu trúc
- Định tuyến ý định: làm lớp phân luồng đầu tiên trong hệ thống đa tác tử
- Tự động hóa dịch vụ khách hàng: trả lời các câu hỏi tiêu chuẩn
- Dịch thuật và phiên âm: xử lý ngôn ngữ cho khối lượng văn bản lớn
Nói một cách đơn giản: đây là những tác vụ không cần suy luận sâu, nhưng khối lượng lớn, nhạy cảm với độ trễ và ngân sách hạn chế.
Sự kết hợp này rất phổ biến trong doanh nghiệp. Nhiều công ty dành hơn một nửa chi tiêu AI cho những tác vụ "không có hàm lượng kỹ thuật cao nhưng bắt buộc phải chạy".
So sánh giá với đối thủ
| Mô hình | Đầu vào ($/1M token) | Đầu ra ($/1M token) |
|---|---|---|
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 |
| Gemini 3.1 Pro | $2,00 | $18,00 |
| GPT-4o Mini | ~$0,15 | ~$0,60 |
| Claude 4.5 Haiku | ~$0,25 | ~$1,25 |
Ở mức giá này, sự cạnh tranh khá gay gắt. GPT-4o Mini rẻ hơn, Claude 4.5 Haiku cũng nằm trong cùng phân khúc. Lợi thế của Flash-Lite là tốc độ (token đầu tiên nhanh hơn 2,5 lần) và cửa sổ ngữ cảnh siêu dài 1M, điều hiếm thấy ở các mô hình cùng giá.
Đánh giá về bản phát hành này
Việc Google tung ra Flash-Lite về bản chất là một động thái chiếm thị phần trong mảng thị trường có độ đồng thời cao.
Phần lớn các nhà phát triển nhỏ và công ty khởi nghiệp khi xây dựng nguyên mẫu sản phẩm đều chọn tiêu chí "đủ dùng và rẻ". Giá của Gemini 3.1 Pro là một rào cản thực sự đối với họ, nhưng mức định giá của Flash-Lite về cơ bản không còn là trở ngại nữa.
Đồng thời, Google cũng dùng mô hình giá rẻ này để giữ chân các nhà phát triển trong hệ sinh thái Vertex AI. Trước hết kéo lưu lượng truy cập bằng Flash-Lite, sau đó các tác vụ nặng trong sản xuất thực tế sẽ được chuyển dần lên Pro và Ultra – lộ trình chuyển đổi này Google đã kiểm chứng trên nhiều khách hàng.
Các tình huống API nhạy cảm về chi phí giờ đây có thêm một lựa chọn.
Nguồn tham khảo: CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE); Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog); Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)