Google công bố ba mẫu Flash vào ngày 21 tháng 7. Nhìn nhanh, đây chỉ là một lần cập nhật Gemini. Nhưng khi đặt giá, tốc độ và mục tiêu sử dụng cạnh nhau, thông điệp rõ hơn: Google muốn AI agent và AI doanh nghiệp chạy rẻ hơn, nhanh hơn và đúng loại việc hơn.
Gemini 3.6 Flash là mẫu tổng hợp, Gemini 3.5 Flash-Lite nhắm tới chi phí thấp và thông lượng cao, còn Gemini 3.5 Flash Cyber dành cho nhiệm vụ an ninh. Cuộc đua mô hình đang chuyển từ bảng xếp hạng đơn lẻ sang thiết kế theo tải công việc.
Lệnh gọi dày đặc cần mô hình rẻ
Google cho biết Flash-Lite mới có tốc độ xuất thời gian thực nhanh hơn thế hệ trước 17% và đạt khoảng 350 tokens/s trong benchmark độc lập. Trang mô hình DeepMind nêu giá 0,30 USD cho một triệu token đầu vào và 2,50 USD cho một triệu token đầu ra.
Với chat thông thường, chất lượng câu trả lời dễ thấy nhất. Với agent, điều phối chăm sóc khách hàng, tự động hóa trình duyệt và xử lý tài liệu hàng loạt, hàng trăm lệnh gọi nhỏ phải nằm trong giới hạn độ trễ và ngân sách.
An ninh được tách thành một mẫu riêng
Flash Cyber là điểm đáng chú ý. Google định vị nó cho phân tích an ninh, nghiên cứu lỗ hổng, phân tích mã độc và phản ứng sự cố, thay vì chat chung.
DeepMind liệt kê kết quả trên CTI-MCQ, CTI-RCM, MARS-EVAL và CyberSecEval. Google nói Flash Cyber cải thiện tới 65% so với 3.5 Flash trên một số benchmark an ninh mạng. Con số này thuộc phạm vi benchmark; khi triển khai trong doanh nghiệp vẫn phải đo cảnh báo sai, bỏ sót và chi phí con người rà soát.
CEO Google Sundar Pichai từng nói cơ hội AI là cực kỳ lớn.
Khách hàng mua sự cân bằng
Trang mô hình của Google dẫn lời Vincent van der Meulen của Figma: khi đánh giá mô hình cho Figma Make, họ tìm sự cân bằng giữa chất lượng, tốc độ và chi phí.
Đó là logic thương mại của Flash. Công cụ thiết kế, trợ lý lập trình, phân tích bảng tính và hệ thống hỗ trợ khách hàng không cần cùng một mẫu cho mọi bước. Bước rủi ro thấp, lặp lại nhiều có thể dùng mẫu rẻ; tác vụ nhạy cảm chuyển sang mẫu mạnh hơn.
Tải thật sẽ quyết định
350 tokens/s của Flash-Lite là số trong bối cảnh benchmark. Độ trễ thực tế còn phụ thuộc độ dài prompt, gọi công cụ, mạng và giới hạn tốc độ. Mức cải thiện 65% của Flash Cyber cũng gắn với các benchmark an ninh được nêu.
Google không chỉ đưa ra một mẫu mạnh hơn. Họ chia các tải khác nhau thành những sản phẩm khác nhau. Giai đoạn cạnh tranh tiếp theo sẽ nằm ở hóa đơn, độ trễ, ranh giới an ninh và độ phù hợp với workflow.
Nguồn: blog chính thức của Google, trang mô hình Google DeepMind, Axios, Business Insider, Artificial Analysis, CocoLoop; kiểm tra vai trò ba mẫu Flash, phạm vi tokens/s, giá trên một triệu token, mức cải thiện benchmark an ninh mạng, trích dẫn khách hàng và phạm vi cung cấp.