Ngày 1/9, Google chính thức ra mắt trên Gemini API một chế độ xử lý video có tên agentic video, giao lại quyền quyết định 'xem video như thế nào' cho chính mô hình. Nhà phát triển có thể dùng ngay, ứng dụng Gemini App sẽ triển khai dần sau đó, còn tính năng Ask YouTube của YouTube dự kiến tích hợp trong vài tháng tới.
Thay đổi nằm ở tầng lấy mẫu. Trước đây Gemini xử lý video theo khung hình cố định, mặc định trích một khung mỗi giây, bất kể đoạn tư liệu là một buổi họp báo hay một đoạn camera giám sát, tất cả đều bị nạp vào ngữ cảnh theo cùng một nhịp. Ở chế độ mới, mô hình được trang bị công cụ video gốc, vừa suy luận vừa quyết định xem đoạn nào, với tốc độ ra sao, đi theo khung hình, âm thanh hay phụ đề, và chỉ lấy về đúng những khoảnh khắc cần thiết.
Ba con số
Kết quả đối chứng mà Google công bố: mức tiêu thụ token giảm tối đa 88%, chi phí giảm tối đa 66%, độ chính xác tăng tối đa 7%. Một kết luận khác đi kèm là Gemini 3.7 Flash đã chạm tới đường biên Pareto giữa độ chính xác và chi phí trong phân tích video — tức cùng mức giá thì không tìm được lựa chọn chính xác hơn, cùng độ chính xác thì không tìm được lựa chọn rẻ hơn.
Trong ba con số, con số thứ ba phản trực giác nhất. Giảm lấy mẫu thường đi kèm mất thông tin, xem ít lẽ ra phải biết ít hơn. Việc điểm số tăng ngược lại là vì lấy mẫu cố định vừa lãng phí vừa bỏ sót cùng lúc: một đoạn ghi hình cuộc họp dài hai tiếng, phần lớn khung hình chỉ là cùng một người đứng trước cùng một slide, nội dung lặp lại chiếm chỗ ngân sách ngữ cảnh; trong khi hành động mấu chốt thực sự có thể chỉ xảy ra trong đúng một giây, và tốc độ 1 khung/giây vừa hay bỏ lỡ nó. Lấy đoạn theo nhu cầu vừa loại bỏ được khung hình dư thừa, vừa có thể nâng mật độ lấy mẫu ở những chỗ cần thiết.
Một phép tính sơ bộ
Một giờ tư liệu lấy mẫu một khung mỗi giây là 3.600 khung, nếu nạp từng khung vào ngữ cảnh, lượng token đầu vào bắt đầu ở mức sáu chữ số (tính sơ bộ). Con số này khiến nhiều nhu cầu không dám làm: một buổi livestream phát lại dài ba tiếng, camera giám sát cửa hàng cả tuần, một bộ phim tài liệu trọn vẹn — chỉ riêng chi phí đọc qua tư liệu một lượt đã vượt quá giá trị kinh doanh mang lại. Cắt giảm 88% thì con số rơi về mức năm chữ số, và ngưỡng để phân tích video dài chuyển từ bản demo trình diễn sang sản phẩm thực tế chính là vượt qua ở quy mô này.
Những gì Google làm đi làm lại trong năm nay trên dòng Flash về cơ bản đều nhắm vào chi phí đơn vị. Ở mảng video, tiến bộ trước đây là kéo dài thời lượng có thể xử lý trong một lần, còn giờ chuyển sang ép giảm chi phí trên mỗi đơn vị thời lượng. Hai việc cộng lại, hiệu quả rõ rệt hơn hẳn so với chỉ làm riêng một việc.
Phạm vi hỗ trợ và cách bật
Các mô hình dùng được là Gemini 3.7 Flash, 3.6 Flash và 3.5 Flash-Lite, truy cập qua Gemini API (thông qua Google AI Studio) và Gemini Enterprise Agent Platform. Cách tính phí vẫn theo giá token tiêu chuẩn của Gemini API, không thu thêm phí tính năng — phần token tiết kiệm được sẽ phản ánh thẳng vào hoá đơn. Thay đổi ở phía nhà phát triển khá nhẹ, chỉ cần đặt phương thức xử lý trong cấu hình thành agentic.
Bốn nhóm ứng dụng tiêu biểu mà Google liệt kê cũng cho thấy họ đang nhắm tới những kịch bản nào: định vị đoạn cắt ở độ chính xác dưới một giây phục vụ dựng phim; tìm kiếm kiểu 'mò kim đáy bể' trong video dài nhiều giờ; phát hiện bất thường nhờ lấy mẫu lại linh hoạt; và đếm chính xác số lượng hành động, vật thể xuyên suốt trục thời gian. Hai nhóm đầu thiên về ngành nội dung, hai nhóm sau rõ ràng nhắm tới các kịch bản công nghiệp như giám sát an ninh, kiểm tra chất lượng, tuần tra kiểm soát.
Các đội ngũ tại Trung Quốc tính bài toán này ra sao
Những đội ngũ làm phân phối video ngắn, kiểm soát chất lượng livestream, rà soát an ninh trước đây gần như không tính nổi bài toán chi phí cho video dài, cách làm phổ biến là dùng mô hình rẻ hoặc thị giác máy tính truyền thống để lọc thô trước, rồi mới đưa các đoạn nghi vấn cho mô hình lớn xử lý. Khi quyền quyết định lấy mẫu được giao lại cho mô hình, quy trình này có thể bớt đi một bước — việc lọc thô tự nó đã được gộp vào quá trình suy luận của mô hình.
Cũng cần nói một câu dè dặt: cả 88%, 66% và 7% đều là con số 'tối đa', lấy từ kịch bản thuận lợi nhất. Tuỳ loại tư liệu, tuỳ loại bài toán mà mức lợi ích thực tế sẽ giảm đi bao nhiêu, Google không công bố phân bố cụ thể. Muốn đưa vào sản xuất thật sự thì vẫn cần tự chạy đối chứng trên chính tư liệu của mình.
Nguồn tham khảo: Blog chính thức của Google, CocoLoop, Google DeepMind; các số liệu giảm token 88%, giảm chi phí 66%, tăng độ chính xác 7% cùng phạm vi mô hình áp dụng và cách tính phí đều được đối chiếu theo thông báo chính thức, phần quy đổi số khung hình là ước tính sơ bộ của biên tập.