Theo Business Insider, một số nhân viên Google đã được tiếp cận bản xem trước (preview) của Gemini 3.8 Flash, thông qua nền tảng lập trình nội bộ mang tên Jetski. Một nhân viên tham gia thử nghiệm mô tả phiên bản này “đã tốt hơn rõ rệt so với 3.7 Flash”, nhưng cũng nói thêm rằng còn quá sớm để đưa ra đánh giá đầy đủ. Google từ chối bình luận về thông tin này.
Nhìn vào dòng thời gian có thể thấy rõ nhịp độ: Gemini 3.6 Flash ra mắt vào tháng 7, 3.7 Flash theo sau ba tuần sau đó, và giờ đây 3.8 Flash đã bước vào giai đoạn thử nghiệm nội bộ. Trong cuộc gọi báo cáo tài chính quý II, CEO Sundar Pichai từng nói công ty đang hướng tới tần suất phát hành gần như hàng tháng. Câu nói khi đó nghe như một mục tiêu, còn bây giờ nó giống một lịch trình đang được thực thi hơn.
Flagship trễ hẹn, Flash lên thay
Lịch trình cho mô hình flagship thế hệ tiếp theo của Google liên tục bị đẩy lùi, và công ty đang dồn nguồn lực cho dòng Flash. Business Insider mô tả dòng Flash là “model chủ lực”, phục vụ chủ yếu cho các tác vụ viết code và chạy agent — hai loại khối lượng công việc có điểm chung là tần suất gọi dày đặc, ngữ cảnh dài, và mức độ chấp nhận về chất lượng mỗi lần gọi cao hơn mức độ chấp nhận về chi phí.
Phép tính đánh đổi này khá dễ hiểu trên sổ sách. Với cùng một pipeline agent, chỉ cần chuyển model từ hạng Pro sang hạng Flash, chi phí suy luận (inference) thường giảm được cả một bậc độ lớn (con số ước tính sơ bộ, mức chênh lệch thực tế còn tùy độ dài ngữ cảnh và tỷ lệ cache hit). Khi các khách hàng doanh nghiệp bắt đầu theo dõi hóa đơn AI hàng tháng, quyền quyết định chọn hạng model đang dần chuyển từ đội ngũ thuật toán sang bộ phận tài chính.
Cửa ngõ mang tên Jetski
Việc nền tảng lập trình nội bộ được tiếp cận model mới trước tiên, tự bản thân sự sắp xếp này đã mang nhiều thông tin. Khối lượng code thực tế mà hàng chục nghìn kỹ sư Google viết mỗi ngày là một môi trường đánh giá đủ lớn, phản hồi đủ dày đặc, gần với môi trường sản xuất thực tế hơn bất kỳ bảng xếp hạng công khai nào. Việc để model chạy vài tuần trên nền tảng lập trình nội bộ trước khi phát hành, về bản chất là giao khoán vòng red-team tốn kém nhất cho chính nhân viên của mình.
Cách làm tương tự cũng thấp thoáng ở OpenAI và Anthropic. Quy mô sử dụng nội bộ của các phòng lab tiên phong đã đủ lớn để đóng vai trò lứa người dùng đầu tiên, nhờ đó tốc độ lặp của model không còn bị giới hạn bởi nhịp độ triển khai thử nghiệm (staged rollout) ra bên ngoài.
Tác dụng phụ khi vòng lặp tăng tốc
Khi model chuyển từ nhịp “mỗi năm một thế hệ” xuống còn “vài tuần một bản”, chu kỳ bán rã của các bảng benchmark cũng rút ngắn theo. Phiên bản trước vừa được tích hợp vào sản phẩm, bản xem trước của phiên bản tiếp theo đã chạy nội bộ; việc chọn model của nhà phát triển từ một quyết định một lần trở thành một chi phí bảo trì liên tục — prompt phải điều chỉnh lại, định dạng gọi tool phải kiểm thử lại, mô hình chi phí phải tính lại.
Với chính Google, việc phát hành dày đặc cũng đang pha loãng sự chú ý dành cho mỗi lần ra mắt. Khoảng cách năng lực thực tế giữa ba phiên bản 3.6, 3.7 và 3.8 hiện chưa có benchmark công khai nào đủ để so sánh. Google cũng chưa đưa ra lịch phát hành công khai cho 3.8 Flash, còn thông số, giá cả và độ dài ngữ cảnh đều chưa được công bố.
Nguồn tham khảo: Business Insider, CocoLoop, biên bản cuộc gọi báo cáo tài chính quý II của Google; tên phiên bản model, tên nền tảng nội bộ và phát biểu của người thử nghiệm dựa theo báo cáo của Business Insider; so sánh chi phí là ước tính sơ bộ của biên tập viên.