Google chia TPU thành hai dòng riêng cho huấn luyện và suy luận

Tại sự kiện Google Cloud Next diễn ra vào ngày 22 tháng 4, Sundar Pichai đã công bố thế hệ TPU thứ tám – không phải một mà là hai con chip: TPU 8t và TPU 8i.

Việc chia một thế hệ sản phẩm thành hai nhánh riêng biệt tự nó đã là một quyết định đáng bàn.

TPU 8t: Dành cho huấn luyện

Chữ "t" trong TPU 8t là viết tắt của training (huấn luyện). Các thông số chính:

Chỉ sốTPU 8t
Kết nối tối đa mỗi pod9.600 chip
Bộ nhớ băng thông cao dùng chung2 PB (mỗi superpod)
Tỷ lệ hiệu năng/giá so với thế hệ trước+2,7x
Độ chính xác dấu phẩy động gốcHỗ trợ bf4 (dấu phẩy động 4-bit)
Tỷ lệ hiệu năng/điện năng so với thế hệ trước+2x

Tích hợp bộ tăng tốc SparseCore, chuyên xử lý các tác vụ truy cập bộ nhớ không đều như embedding. Cấu trúc liên kết mạng sử dụng 3D torus.

Mục tiêu của Google là rút ngắn chu kỳ huấn luyện các mô hình frontier từ "hàng tháng" xuống còn "hàng tuần".

TPU 8i: Dành cho suy luận

Chữ "i" trong TPU 8i là viết tắt của inference (suy luận).

Chỉ sốTPU 8i
Kết nối tối đa mỗi pod1.152 chip
SRAM gấp so với thế hệ trước3 lần
Số bước nhảy truyền thông all-to-allGiảm 50%
Tỷ lệ hiệu năng/giá so với thế hệ trước+80% (trong tác vụ độ trễ thấp)

Sử dụng cấu trúc liên kết mạng Boardfly ICI tự phát triển, tích hợp Collectives Acceleration Engine chuyên tăng tốc giải mã tự hồi quy – một trong những nút thắt cổ chai cốt lõi của suy luận mô hình lớn.

Tại sao lại chia thành hai nhánh?

Thế hệ Ironwood trước đây là một con chip đảm nhiệm cả huấn luyện lẫn suy luận.

Giờ đây, nhận định của Google là: trong kỷ nguyên agent, hình thái suy luận hoàn toàn khác với huấn luyện.

Huấn luyện là: khối lượng lớn, một lần, ưu tiên thông lượng.
Suy luận (đặc biệt là agent) là: chạy liên tục, độ trễ thấp, đồng thời chạy hàng triệu agent.

Một kiến trúc duy nhất phục vụ cả hai kịch bản chắc chắn sẽ phải thỏa hiệp về hiệu quả phần cứng. Vì vậy, Google quyết định tách riêng, tối ưu từng nhánh đến mức tối đa.

Đây là một canh bạc của Google về hình thái tính toán AI trong tương lai, không chỉ đơn thuần là ra mắt "con chip nhanh hơn".

Nvidia có lo lắng không?

Google không hề "kêu gọi" Nvidia – và cùng ngày, họ thông báo sẽ cung cấp chip Vera Rubin của Nvidia cho khách hàng Cloud vào cuối năm 2026.

Đây là một động thái thực tế. Khối lượng công việc doanh nghiệp phụ thuộc rất nhiều vào hệ sinh thái CUDA, chi phí chuyển đổi cao, không thể thực hiện trong một sớm một chiều. Chip tự phát triển của Google và chip Nvidia cùng tồn tại trong cùng một đám mây, không phải là "chọn một trong hai".

Nhưng hướng đi đã rõ ràng: mỗi thế hệ TPU đẩy tỷ lệ hiệu năng/giá lên một bậc, khách hàng càng có thêm lý do để chọn con đường thuần Google.

Nhân tiện, một số liệu bối cảnh: 75% mã nguồn mới nội bộ của Google hiện được tạo ra bởi AI (hồi mùa thu năm ngoái là 50%). Những dòng mã này cuối cùng chạy trên nền tảng nào? Chip do chính họ chế tạo. Vòng tuần hoàn này đang dần tăng tốc.

Nguồn tham khảo: CocoLoop, Google Cloud launches two new AI chips to compete with Nvidia (TechCrunch); Two new TPUs to power the next wave of AI training and inference at Google (SiliconANGLE); Our eighth generation TPUs: two chips for the agentic era (Google Blog); Sundar Pichai shares news from Google Cloud Next 2026 (Google Blog)