Ngày 30/9, Google phát hành mô hình tiền tuyến thế hệ mới mang tên Gemini 4 Argon, nhưng trong đợt đầu chỉ dành cho các đội phòng thủ an ninh mạng nằm trong chương trình Fairwind. Google giới hạn phạm vi công việc của mô hình này trong ba nhóm: kỹ thuật phần mềm, công việc tri thức doanh nghiệp như pháp lý và tài chính, và phòng thủ an ninh mạng. Khách hàng API trả phí và người dùng gói Google AI Ultra sẽ được tiếp cận ở đợt kế tiếp, còn việc mở rộng ra công chúng vẫn chưa có mốc thời gian cụ thể.
Việc ưu tiên cho đội an ninh mạng gắn với hướng huấn luyện của mô hình này. Google cho biết Argon được huấn luyện chuyên sâu cho phòng thủ mạng, có khả năng tự phát hiện, xác minh và vá các lỗ hổng phần mềm nghiêm trọng. Với các bên phòng thủ đáng tin cậy trong Fairwind và các đội nội bộ của Google, Argon được cung cấp ở dạng không có rào chắn an ninh mạng; người dùng khác nhận được phiên bản có các biện pháp chống lạm dụng, chống chèn lệnh (prompt injection) và giám sát độ căn chỉnh (alignment).
Bảng điểm chính thức
Google công bố một số điểm số đánh giá chuẩn (benchmark) như sau:
| Benchmark | Hướng | Điểm Argon |
|---|---|---|
| DeepSWE v1.1 | Kỹ thuật phần mềm thực tế | 77,9% |
| CWE-bench v1 | Vá lỗ hổng | 68% (đồng hạng nhất) |
| AutomationBench | Tác vụ tự động hóa | 51,3% (hạng nhất) |
| LVBench | Hiểu video dài | 91,7% |
Hai bài test khác chỉ công bố thứ hạng: Vals Index bao quát tài chính, lập trình, pháp lý và thuế, Google nói Argon dẫn đầu; bài test chèn lệnh gián tiếp của Gray Swan, Google nói khả năng chống chèn lệnh của Argon là tốt nhất. Tất cả đều do hãng tự công bố, và trong ngày ra mắt chỉ có một bên thứ ba thực hiện kiểm tra lại độc lập.
Độ dài đầu ra là một thay đổi đáng chú ý khác. Giới hạn đầu ra một lượt của thế hệ Gemini trước là 64.000 token, Argon nâng lên 1 triệu token, cửa sổ ngữ cảnh cũng là 1 triệu token.
Giá cả và kiểm tra độc lập
Trong giai đoạn ra mắt, API tính phí theo giá ưu đãi: 2 USD cho mỗi triệu token đầu vào, 10 USD cho mỗi triệu token đầu ra, token đầu vào trúng cache được giảm thêm 95%. Sau khi hết ưu đãi, giá quay về 4 USD đầu vào và 20 USD đầu ra; Google không nói rõ ưu đãi kéo dài bao lâu.
Tổ chức đánh giá độc lập Artificial Analysis đã công bố kết quả kiểm tra ngay trong ngày. Argon đạt 53 điểm trên chỉ số thông minh của họ, ngang với mức cao nhất của GPT-6 Astra, cao hơn 1 điểm so với mức cao nhất của GPT-6.1 Sol, và cao hơn 23 điểm so với mức 30 của thế hệ trước Gemini 3.1 Pro Preview.
So sánh chi phí mỗi tác vụ trên cùng bộ chỉ số này:
- Argon chạy một tác vụ với giá ưu đãi khoảng 1,99 USD, trong khi GPT-6 Astra là 3,26 USD;
- Sau khi hết ưu đãi, Argon tăng lên khoảng 3,98 USD, đắt hơn Astra khoảng 20%;
- GPT-6.1 Sol chỉ khoảng 0,72 USD mỗi tác vụ, điểm số chỉ thấp hơn 1 điểm, giá ưu đãi của Argon cao gấp khoảng 2,8 lần.
Chênh lệch chủ yếu đến từ lượng token sử dụng. Theo Artificial Analysis, Argon sinh ra trung bình khoảng 62.000 token đầu ra mỗi tác vụ, trong khi GPT-6 Astra khoảng 27.000, tức nhiều hơn gấp đôi. Đơn giá giảm một nửa nhưng sản lượng tăng gấp đôi, khiến lợi thế giá ở mức giá gốc gần như bị triệt tiêu. Argon hỗ trợ một cơ chế gọi là "suy luận nối dài" (long decode continuation), quá trình suy luận có thể viết tới 1 triệu token đầu ra, điều này giải thích vì sao lượng token của nó cao hơn trong bài test chỉ số.
Rào chắn dành cho ai
Cùng tuần này, OpenAI vừa hủy kế hoạch phát hành GPT-6.1 Astra với lý do chưa đạt tiêu chuẩn an toàn, chuyển sang ra mắt phiên bản rẻ hơn là Sol. Cách làm của Google là đưa phiên bản mạnh nhất vào một danh sách được kiểm soát trước. Hai hãng xử lý khác nhau nhưng đối mặt cùng một vấn đề: mô hình càng giỏi tìm lỗ hổng và viết bản vá, nguy cơ bị lợi dụng để tấn công càng lớn.
Google không công bố trong blog phát hành những tổ chức nào nằm trong danh sách Fairwind, tiêu chí xét duyệt ra sao, hay làm thế nào để ngăn phiên bản không rào chắn bị rò rỉ ra ngoài. Đối với các nhà phát triển Trung Quốc, Argon hiện cũng rất khó tiếp cận: Fairwind hoạt động theo hình thức mời, thời điểm mở cho gói Ultra và API trả phí vẫn chưa xác định, còn bản thân Gemini API cũng không phục vụ Trung Quốc đại lục.
Nguồn tham khảo: Blog chính thức của Google, báo cáo đánh giá của Artificial Analysis, CocoLoop, VentureBeat; điểm benchmark theo công bố của Google, chi phí mỗi tác vụ và lượng token sử dụng theo chỉ số thông minh của Artificial Analysis.