Google DeepMind phát hành Gemini 3.8 Flash vào ngày 2 tháng 9. Theo model card chính thức, mô hình này được xây dựng trên nền 3.7 Flash, với các cải tiến tập trung vào kỹ thuật phần mềm và quy trình làm việc tri thức dạng tác nhân (agentic). Thời điểm ra mắt chỉ cách vài ngày sau khi bản thử nghiệm nội bộ dành cho nhân viên bị rò rỉ.
Thông số kỹ thuật không thay đổi nhiều: cửa sổ ngữ cảnh đầu vào tối đa 1 triệu token, giới hạn đầu ra một lượt là 64.000 token, kiến thức được cập nhật đến tháng 3 năm 2026, dù một số lĩnh vực vẫn dừng ở tháng 1 năm 2025. Mô hình được triển khai đồng loạt trên nhiều kênh: ứng dụng Gemini, AI Studio, Gemini API, Gemini Enterprise Agent Platform, Google AI Mode và công cụ lập trình Antigravity. Mô hình hỗ trợ mức nỗ lực (effort level) có thể điều chỉnh, cho phép nhà phát triển tự cân bằng giữa chất lượng, chi phí và độ trễ.
Hai gương mặt trong cùng một bảng
Bảng so sánh chính thức đặt 3.8 Flash cạnh 3.7 Flash, Claude Opus 5, Claude Sonnet 5, GPT-5.6 Sol và GPT-5.6 Terra; điểm đáng chú ý nằm ở sự lệch pha giữa giá và điểm số.
3.8 Flash vẫn giữ mức giá khuyến mãi: 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho đầu ra; trong khi Claude Opus 5 có giá 5 USD và 25 USD, cách biệt hơn sáu lần. Với khoảng cách giá này, trên Terminal-bench 2.1 hai mô hình đạt 89,4 so với 89,1, gần như ngang nhau; CharXiv Reasoning là 86,2 so với 83,7, HLE-Verified 54,9 so với 54,4, tác vụ phân tích tài chính 61,4 so với 58,6, quy trình pháp lý Harvey 10,0 so với 6,7 — tất cả đều nghiêng về 3.8 Flash; riêng tác vụ hiểu video dài thì khoảng cách nới rộng hơn, 87,8 so với 75,4.
Nhưng khi tác vụ kéo dài ra, cục diện đảo ngược. Terminal-bench 4.0, đánh giá năng lực tác nhân tổng quát hơn, Opus 5 đạt 51,8 trong khi 3.8 Flash chỉ được 19,1; OSWorld-2.0, đo khả năng tác nhân thao tác máy tính, là 75,4 so với 59,0; điểm Elo của GDPVal-AA v2, đo công việc tri thức, là 1824 so với 1545. Với các tác vụ kỹ thuật phần mềm chu kỳ dài kiểu DeepSWE, kết quả là 74,0 so với 71,0 — chênh lệch không lớn nhưng cùng một xu hướng.
Quy luật khá rõ: tác vụ càng ngắn, càng gần với phán đoán một lượt, ảnh hưởng của mức giá càng nhỏ; tác vụ càng dài, càng đòi hỏi mô hình tự duy trì trạng thái và tự sửa lỗi, khoảng cách giữa các mức giá lại nới rộng trở lại. Tính nhẩm một phép: để chạy xong cùng một quy trình lập trình có độ phức tạp trung bình, chi phí suy luận của 3.8 Flash chỉ bằng khoảng một phần sáu so với Opus 5, trong khi kết quả chênh nhau chưa tới một điểm phần trăm; nhưng đổi sang quy trình tác nhân cần thao tác liên tục vài chục bước, số tiền tiết kiệm được sẽ bị chi phí thử lại khi thất bại ăn mòn bao nhiêu thì phải tự thử mới biết.
So với 3.7 Flash, mức cải thiện là có thật. DeepSWE tăng từ 65,3 lên 71,0, Terminal-bench 4.0 từ 11,2 lên 19,1, OSWorld từ 50,6 lên 59,0, mức khó của quy trình nghiên cứu sinh học nhảy từ 43,4 lên 56,5. Với nhịp độ ra bản mới vài tuần một lần, mức tăng này không hề nhỏ.
Người dùng biết trước cả thông báo
Trước khi model card chính thức được đăng, cộng đồng nhà phát triển đã nhận ra điều bất thường: trên bản web và trong Antigravity, mô hình vẫn được gắn nhãn 3.7 Flash, nhưng khi được hỏi “bạn là mô hình nào”, nó lại trả lời mình là 3.8 Flash. Cũng có người đang dùng thì bỗng thấy bộ chọn mô hình xuất hiện thêm một dòng 3.8 Flash, với mức nỗ lực mặc định được đặt ở High.
Việc âm thầm thay mô hình là thao tác thường thấy ở các phòng thí nghiệm hàng đầu, giúp họ chạy thử một vòng dưới tải thực tế, có vấn đề thì lập tức chuyển lại. Cái giá phải trả rơi vào phía người dùng: hành vi dưới cùng một tên mô hình đã thay đổi vào một thời điểm nào đó, hiệu quả của prompt, mức tiêu thụ token, phong cách đầu ra đều có thể thay đổi theo, và những điều này thường không được ghi vào bất kỳ nhật ký cập nhật nào. Với các đội tính phí theo token, biến động trên hóa đơn đến sớm hơn cả thông báo chính thức.
Đợt kiểm tra đầu tiên của cộng đồng vẫn dùng cách cũ: yêu cầu mô hình tạo một hoạt ảnh hệ mặt trời trong một lần, hoặc vẽ một con SVG hình chim bồ nông. Những bài test kiểu này không mang tính khoa học, nhưng có ưu điểm là ngưỡng thấp, tốt xấu nhìn là biết ngay, và thường là tham chiếu duy nhất trước khi có điểm số chính thức. Đánh giá cũng không thống nhất, người khen kẻ chê, giống như mọi lần cập nhật mô hình khác.
Giá rẻ có thời hạn
Model card liệt kê vài giới hạn đã biết: tình trạng phản hồi chậm và timeout thỉnh thoảng vẫn xảy ra; khi tăng mức nỗ lực, mô hình sẽ tiêu tốn thêm token để đẩy hiệu năng, nên chi phí thực tế chưa chắc tăng tuyến tính theo bảng giá niêm yết. Về an toàn, phía chính thức cho biết nhìn chung tương đương 3.7 Flash, đội red team con người xác nhận đạt ngưỡng an toàn trẻ em để triển khai, còn các chỉ số an toàn ở những ngữ cảnh phi tiếng Anh có sụt nhẹ.
Bên dưới cột giá còn có một dòng chữ nhỏ: giá khuyến mãi của 3.7 và 3.8 Flash sẽ kết thúc vào ngày 31 tháng 12, từ ngày 1 tháng 1 năm sau sẽ trở lại mức 1,5 USD cho mỗi triệu token đầu vào và 7,5 USD cho đầu ra — đúng bằng gấp đôi. Bảng hiệu năng trên giá thành này, bốn tháng nữa sẽ phải tính lại từ đầu.
Nguồn tham khảo: Model card của Google DeepMind, CocoLoop, bảng so sánh hiệu năng chính thức của Google, thảo luận trong cộng đồng nhà phát triển; độ dài ngữ cảnh, giới hạn đầu ra, thời điểm cập nhật kiến thức và các kênh phân phối được đối chiếu theo model card, các điểm số benchmark và đơn giá mỗi triệu token lấy từ bảng so sánh chính thức.