Ngày 6 tháng 10, Google DeepMind ra mắt mô hình tạo ảnh Nano Banana 2.1, cùng ngày chuyển sang trạng thái chính thức trong Gemini API với mã mô hình gemini-nano-banana-2.1. Đây là bản cập nhật của Nano Banana 2 (tên giao diện gemini-3.1-flash-image), và giao diện cũ sẽ ngừng hoạt động vào ngày 29 tháng 10.
Theo thẻ mô hình chính thức, Nano Banana 2.1 thuộc dòng Gemini 3, dựa trên nền Gemini 3.6 Flash, bản chất là một mô hình suy luận đa phương thức gốc. Đầu vào hỗ trợ văn bản và hình ảnh, cửa sổ ngữ cảnh tối đa 1 triệu token; đầu ra có thể là hình ảnh, hoặc văn bản dài tối đa 64.000 token.
Những gì đã thay đổi
Nhật ký cập nhật API liệt kê bốn cải tiến: chất lượng hình ảnh, khả năng tuân theo prompt, tính nhất quán của nhân vật trong các lượt đối thoại nhiều vòng, và hiển thị chữ. Điểm mới là tỷ lệ khung hình siêu rộng, hỗ trợ bốn tỷ lệ 1:4, 4:1, 1:8, 8:1, độ phân giải có thể chọn 1K, 2K, 4K. Google cho biết tốc độ và chi phí vẫn giữ ở mức của hạng Flash.
Thẻ mô hình đưa ra hai nhóm số liệu so sánh:
- Điểm đánh giá ưu tiên tổng thể của con người cho tạo ảnh từ văn bản, phiên bản Thinking của Nano Banana 2.1 đạt 1050 (±14), trong khi Nano Banana 2 là 990 (±7);
- Độ chính xác thực tế của ảnh thông tin (infographic) tăng từ 0,179 lên 0,521.
Mức tăng sau gần gấp ba lần. Ảnh thông tin đòi hỏi mô hình vừa vẽ đúng, vừa phải chính xác về số liệu và chú thích, đây từng là điểm yếu nhất của các mô hình tạo ảnh. 0,521 vẫn có nghĩa là gần một nửa ảnh thông tin còn vấn đề về tính chính xác, nên khi dùng cho tài liệu chính thức vẫn cần kiểm tra lại bằng tay.
Những hạn chế mà chính Google công bố
Thẻ mô hình liệt kê một số hạn chế đã biết: hiển thị chữ kém với cỡ chữ nhỏ và đoạn văn dài; tính nhất quán của nhân vật giữa đầu vào và đầu ra không được đảm bảo; khả năng suy luận định vị không gian còn hạn chế, đôi khi nhầm lẫn các hướng như trái và phải. Về thời điểm giới hạn kiến thức, một số lĩnh vực đến tháng 3 năm 2026, một số lĩnh vực khác chỉ đến tháng 1 năm 2025.
Về an toàn, thẻ mô hình cho biết mô hình đã vượt qua ngưỡng an toàn trẻ em để ra mắt, nhóm red team chuyên biệt không phát hiện vấn đề nghiêm trọng, và trong đánh giá an toàn tiên phong không chạm đến bất kỳ mức năng lực cần theo dõi hoặc then chốt nào.
Đã được tích hợp vào đâu
Ngoài Gemini App, Google AI Studio và Gemini API, Nano Banana 2.1 cũng được tích hợp vào AI Mode của Tìm kiếm, Google Ads, công cụ video Flow và công cụ thiết kế Stitch. Hai lối vào quảng cáo và tìm kiếm cho thấy Google có ý định dùng mô hình này trực tiếp để tạo hàng loạt vật liệu thương mại.
Đối với các nhà phát triển ở Trung Quốc đại lục
Gemini API không thể truy cập trực tiếp tại Trung Quốc đại lục, các nhóm trong nước phần lớn gọi qua cloud nước ngoài hoặc các nền tảng tổng hợp bên thứ ba. Giao diện cũ sẽ ngừng hoạt động sau 23 ngày, việc liệu các nền tảng tổng hợp có kịp chuyển đổi bản đồ mô hình hay không là khâu dễ gặp vấn đề nhất; các nhóm đang chạy tác vụ sản xuất bằng gemini-3.1-flash-image nên đổi sang mã mới trong môi trường thử nghiệm ngay trong tuần này.
Với bối cảnh tiếng Trung còn một điểm cần lưu ý. Thẻ mô hình ghi nhận việc hiển thị chữ cỡ nhỏ kém là một hạn chế, mà chữ Hán có nét dày đặc, ở cùng cỡ chữ dễ bị mờ hơn tiếng Anh; khi làm poster hay ảnh chính thương mại điện tử, tiêu đề lớn không vấn đề gì, nhưng phần chữ nhỏ có thể vẫn cần chỉnh sửa thủ công sau đó. Google hiện chưa công bố riêng dữ liệu đánh giá cho hiển thị chữ Hán.
Nhật ký cập nhật cũng chưa công bố giá của mô hình mới, liệu có áp dụng tiêu chuẩn tính phí của Nano Banana 2 hay không, Google vẫn chưa nói rõ.
Nguồn tham khảo: CocoLoop, thẻ mô hình Google DeepMind, nhật ký cập nhật Gemini API; điểm đánh giá ưu tiên và độ chính xác ảnh thông tin theo kết quả đánh giá được công bố trong thẻ mô hình, lịch ngừng hoạt động theo nhật ký cập nhật Gemini API.