Gemini 3.1 Pro đạt 12/18 vị trí dẫn đầu trong các bài kiểm tra benchmark

Cuối tháng 2, Google DeepMind đã phát hành Gemini 3.1 Pro. Sau khi ra mắt, một con số đã lan truyền rộng rãi trong cộng đồng nhà phát triển: trong số 18 benchmark chính hiện đang được theo dõi, 3.1 Pro đã giành được 12 vị trí dẫn đầu.

Đáng chú ý hơn là ARC-AGI-2 — bài kiểm tra được thiết kế đặc biệt để đánh giá khả năng giải quyết "các bài toán logic mới chưa từng thấy" của mô hình, ngăn chặn việc mô hình học thuộc lòng dữ liệu huấn luyện để vượt qua. 3.1 Pro đã đạt 77,1% trên bài kiểm tra này.

Khả năng suy luận tăng gấp đôi thực sự có ý nghĩa gì

Google chính thức cho biết khả năng suy luận của 3.1 Pro đã được cải thiện hơn 2 lần so với Gemini 3 Pro.

Nghe có vẻ mơ hồ, nhưng kết hợp với kết quả ARC-AGI-2, điều này trở nên thuyết phục. ARC-AGI đưa ra các câu hỏi hoàn toàn mới mỗi lần, yêu cầu mô hình xem một vài ví dụ, khái quát hóa quy tắc và áp dụng — không thể dựa vào việc học thuộc câu trả lời, chỉ có thể dựa vào suy luận thực sự.

Cải thiện gấp đôi, tương ứng với: đưa ra một vấn đề phức tạp nhiều bước, mô hình có thể tự phân tích, suy luận và xác minh mà không cần bạn hướng dẫn từng bước trong prompt. Đã thêm Mức độ Suy luận MEDIUM mới (trước đây chỉ có hai mức bật/tắt), giờ đây có thể kiểm soát độ sâu suy luận — không phải mọi tác vụ đều cần suy luận sâu nhất, có thể điều chỉnh theo nhu cầu.

Thông số kỹ thuật

Ngữ cảnh và đầu ra:

  • Cửa sổ ngữ cảnh: 1 triệu token
  • Đầu ra tối đa: 65K token

Các định dạng đầu vào được hỗ trợ:

  • Văn bản và mã nguồn
  • Hình ảnh (tối đa 3000 ảnh mỗi lần, mỗi ảnh tối đa 7MB)
  • Âm thanh (tối đa 8,4 giờ)
  • Video (có âm thanh khoảng 45 phút, chỉ video khoảng 1 giờ)
  • PDF (tối đa 3000 trang mỗi lần, mỗi tệp tối đa 50MB)

1 triệu token có thể chứa được gì? Khoảng toàn bộ mã nguồn của một kho mã lớn, hoặc 900 trang PDF, hoặc 8,4 giờ âm thanh podcast. Ném toàn bộ dự án vào và đặt câu hỏi trực tiếp, giờ đây thực sự có thể thực hiện được.

Tính năng hữu ích

Ngoài khả năng suy luận, 3.1 Pro đã bổ sung một số tính năng thiết thực:

  • Grounding with Google Search: có thể tìm kiếm thời gian thực khi trả lời, giảm các vấn đề do ngày cắt kiến thức
  • Thực thi mã: mô hình có thể trực tiếp chạy mã để xác minh kết quả, không chỉ tạo mã
  • Tối ưu hóa chuyên biệt cho Tài chính và Bảng tính: hai kịch bản agent này đã được tinh chỉnh riêng
  • Tích hợp RAG Engine: kết nối với cơ sở tri thức doanh nghiệp dễ dàng hơn

Cũng hỗ trợ dự đoán hàng loạt, chi phí cho các tác vụ ngữ cảnh dài sẽ thấp hơn nhiều nếu sử dụng bộ nhớ đệm.

Định giá

Hạng mụcGiá
Đầu vào$2,00/M token
Đầu ra$12,00/M token
Đầu vào chế độ Suy luận$12,00/M token
Đọc bộ nhớ đệm$0,20/M token
Ghi bộ nhớ đệm$0,38/M token

So với Claude Opus 4.6 ($15/$75) rẻ hơn nhiều, và gần với GPT-5.4 Pro. Nếu sử dụng nhiều bộ nhớ đệm, chi phí cho các tác vụ ngữ cảnh dài sẽ được giảm xuống khá thấp.

Hiện đang ở giai đoạn xem trước công khai, ngày cắt kiến thức là tháng 1 năm 2025.

Nhưng vị trí dẫn đầu tổng thể vẫn chưa thuộc về nó

Nói thật: trong bảng xếp hạng benchmark tổng thể, điểm số của GPT-5.4 Pro là 92 (BenchLM.ai), Gemini 3.1 Pro là 87, Claude Opus 4.6 là 85.

Đã thắng 12/18 bài kiểm tra đơn lẻ, nhưng vẫn còn thiếu một chút ở một số khía cạnh năng lực chính. Đặc biệt là các tác vụ lập trình, hiệu suất SWE-bench của Claude Opus 4.6 vẫn mạnh hơn.

Google đã đưa ra câu trả lời này về suy luận và xử lý đa phương thức, nhưng vị trí dẫn đầu toàn diện vẫn chưa thuộc về họ.

Có đáng để chuyển sang không

Nếu công việc kinh doanh của bạn chủ yếu là:

  • Xử lý tài liệu dài (hợp đồng, báo cáo, đánh giá kho mã)
  • Đầu vào đa phương thức (xử lý đồng thời hình ảnh + văn bản + âm thanh)
  • Ngân sách hạn chế nhưng cần khả năng suy luận gần với cấp độ Opus

3.1 Pro là một lựa chọn nghiêm túc, có tỷ lệ giá/hiệu suất khá cạnh tranh.

Nhưng nếu nhu cầu cốt lõi là viết mã, làm agent, Claude vẫn trưởng thành hơn. Trong lần phát hành này, Google đã đạt được 77,1% trên ARC-AGI-2, cho thấy khả năng suy luận thực sự đang tiến bộ, không chỉ là điểm số. Nhưng để thay thế hoàn toàn Claude và GPT-5.4, vẫn còn một khoảng cách nhỏ.

Nguồn tham khảo: Google's new Gemini Pro model has record benchmark scores — again (TechCrunch); CocoLoop, Gemini 3.1 Pro: A smarter model for your most complex tasks (Google DeepMind Blog); Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks (Galaxy.ai); Gemini 3.1 Pro | Google Cloud Vertex AI Documentation