Cuối tháng 3 năm ngoái, Google đã phát hành Gemini 2.5 Pro, được mô tả là "mô hình thông minh nhất từ trước đến nay".
Loại tuyên bố này hãng nào cũng có thể đưa ra, nhưng lần này điểm số của Gemini 2.5 Pro thực sự có điều đáng nói:
Suy luận toán học và khoa học
- AIME 2024: 92,0%
- AIME 2025: 86,7%
- Humanity's Last Exam: 18,8% (cao nhất trong số các mô hình không sử dụng công cụ)
Bài kiểm tra cuối cùng do hàng trăm chuyên gia trong nhiều lĩnh vực biên soạn, được thiết kế để kiểm tra "ranh giới tri thức của con người". Việc đạt được tỷ lệ chính xác gần 20% là một kết quả khá ấn tượng.
Lập trình và đa phương thức
- LiveCodeBench: Xếp hạng nhất về lập trình cạnh tranh
- MMMU: 84,0% (suy luận đa phương thức)
- WebDevArena Elo: 1443 (đứng đầu bảng xếp hạng)
Khả năng ngữ cảnh
Tiêu chuẩn có ngữ cảnh 1 triệu token (có thể mở rộng lên 2 triệu), hỗ trợ đầu vào đa phương thức như văn bản, âm thanh, hình ảnh, video. Có thể đưa toàn bộ kho mã nguồn vào và hiểu trực tiếp mà không cần cắt nhỏ.
Gemini 2.5 Pro là một "thinking model" – nó sẽ suy luận nội bộ trước khi trả lời. Thiết kế này cùng chung hướng đi với dòng o của OpenAI và DeepSeek R1, nhưng cách triển khai của Google cho thấy sự cân bằng tốt hơn trong các tình huống đa phương thức.
Tuy nhiên, có một vấn đề thường xuyên được nhắc đến trong quá trình sử dụng thực tế: tốc độ phản hồi. Suy luận sâu đồng nghĩa với thời gian chờ đợi lâu hơn, làm giảm trải nghiệm trong các tình huống cần tương tác nhanh. Đây cũng là sự đánh đổi chung mà tất cả các thinking model phải đối mặt.
Trên LMArena, Elo của mô hình đạt 1470, tăng 24 điểm so với trước khi ra mắt, duy trì vị trí dẫn đầu bảng xếp hạng. Google đã bị chỉ trích nhiều trong lĩnh vực AI, và lần này họ đã đáp trả bằng chất lượng sản phẩm.
Nguồn tham khảo: CocoLoop, bài báo của VentureBeat, thông báo chính thức của Google