4月22日的 Google Cloud Next 上,Sundar Pichai 發表了第八代 TPU——不是一款晶片,而是兩款:TPU 8t 和 TPU 8i。
把一代產品拆成兩塊,這個決策本身就值得討論。
TPU 8t:專為訓練設計
TPU 8t 中的「t」代表 training(訓練)。核心規格如下:
| 指標 | TPU 8t |
|---|---|
| 單一 pod 最大連接晶片數 | 9,600 顆 |
| 共享高頻寬記憶體 | 2PB(單一 superpod) |
| 效能/價格比(前代相比) | +2.7 倍 |
| 原生浮點精度 | 支援 bf4(4 位元浮點數) |
| 效能/功耗比(前代相比) | +2 倍 |
內建 SparseCore 加速器,專門處理 embedding 這類記憶體存取不規則的場景。網路拓撲採用 3D torus。
Google 的目標是將 frontier 模型的訓練週期從「按月計算」壓縮到「按週計算」。
TPU 8i:專為推理設計
TPU 8i 中的「i」代表 inference(推理)。核心規格如下:
| 指標 | TPU 8i |
|---|---|
| 單一 pod 最大連接晶片數 | 1,152 顆 |
| SRAM 容量(前代相比) | 3 倍 |
| all-to-all 通訊跳數 | 減少 50% |
| 效能/價格比(前代相比,低延遲場景) | +80% |
採用自行研發的 Boardfly ICI 網路拓撲,內建 Collectives Acceleration Engine,專門加速自迴歸解碼——這是大型模型推理的核心瓶頸之一。
為什麼要拆成兩塊?
前一代 Ironwood 是一款晶片同時兼顧訓練和推理。
現在 Google 的判斷是:在 agent 時代,推理的型態與訓練完全不同。
訓練是:大批量、一次性、吞吐量優先。
推理(特別是 agent)是:持續運行、低延遲、同時運行數百萬個 agent 並發。
一套架構要同時最佳化這兩種場景,硬體效率必然妥協。索性拆開,各自最佳化到極致。
這是 Google 對未來 AI 運算型態的一次押注,不只是「更快的晶片」發表。
Nvidia 緊張嗎?
Google 沒有直接對 Nvidia 喊話——而且同一天宣布將在 2026 年稍晚為 Cloud 客戶提供 Nvidia 的 Vera Rubin 晶片。
這很務實。企業工作負載高度依賴 CUDA 生態系,遷移成本高,不是一朝一夕的事。Google 自研晶片和 Nvidia 晶片在同一個雲端中共存,並不是「二選一」。
但方向是清楚的:每一代 TPU 把性價比推高一個數量級,客戶選擇純 Google 路線的理由就多一分。
順帶一提背景數據:Google 內部有 75% 的新程式碼現在由 AI 生成(去年秋天是 50%)。這些程式碼最終跑在什麼上面?他們自己打造的晶片。這個循環正在慢慢加速。
參考來源:CocoLoop、Google Cloud launches two new AI chips to compete with Nvidia(TechCrunch);Two new TPUs to power the next wave of AI training and inference at Google(SiliconANGLE);Our eighth generation TPUs: two chips for the agentic era(Google Blog);Sundar Pichai shares news from Google Cloud Next 2026(Google Blog)