Google 將 TPU 拆分為訓練與推理兩條產品線

4月22日的 Google Cloud Next 上,Sundar Pichai 發表了第八代 TPU——不是一款晶片,而是兩款:TPU 8t 和 TPU 8i。

把一代產品拆成兩塊,這個決策本身就值得討論。

TPU 8t:專為訓練設計

TPU 8t 中的「t」代表 training(訓練)。核心規格如下:

指標TPU 8t
單一 pod 最大連接晶片數9,600 顆
共享高頻寬記憶體2PB(單一 superpod)
效能/價格比(前代相比)+2.7 倍
原生浮點精度支援 bf4(4 位元浮點數)
效能/功耗比(前代相比)+2 倍

內建 SparseCore 加速器,專門處理 embedding 這類記憶體存取不規則的場景。網路拓撲採用 3D torus。

Google 的目標是將 frontier 模型的訓練週期從「按月計算」壓縮到「按週計算」。

TPU 8i:專為推理設計

TPU 8i 中的「i」代表 inference(推理)。核心規格如下:

指標TPU 8i
單一 pod 最大連接晶片數1,152 顆
SRAM 容量(前代相比)3 倍
all-to-all 通訊跳數減少 50%
效能/價格比(前代相比,低延遲場景)+80%

採用自行研發的 Boardfly ICI 網路拓撲,內建 Collectives Acceleration Engine,專門加速自迴歸解碼——這是大型模型推理的核心瓶頸之一。

為什麼要拆成兩塊?

前一代 Ironwood 是一款晶片同時兼顧訓練和推理。

現在 Google 的判斷是:在 agent 時代,推理的型態與訓練完全不同

訓練是:大批量、一次性、吞吐量優先。
推理(特別是 agent)是:持續運行、低延遲、同時運行數百萬個 agent 並發。

一套架構要同時最佳化這兩種場景,硬體效率必然妥協。索性拆開,各自最佳化到極致。

這是 Google 對未來 AI 運算型態的一次押注,不只是「更快的晶片」發表。

Nvidia 緊張嗎?

Google 沒有直接對 Nvidia 喊話——而且同一天宣布將在 2026 年稍晚為 Cloud 客戶提供 Nvidia 的 Vera Rubin 晶片。

這很務實。企業工作負載高度依賴 CUDA 生態系,遷移成本高,不是一朝一夕的事。Google 自研晶片和 Nvidia 晶片在同一個雲端中共存,並不是「二選一」。

但方向是清楚的:每一代 TPU 把性價比推高一個數量級,客戶選擇純 Google 路線的理由就多一分

順帶一提背景數據:Google 內部有 75% 的新程式碼現在由 AI 生成(去年秋天是 50%)。這些程式碼最終跑在什麼上面?他們自己打造的晶片。這個循環正在慢慢加速。

參考來源:CocoLoop、Google Cloud launches two new AI chips to compete with Nvidia(TechCrunch);Two new TPUs to power the next wave of AI training and inference at Google(SiliconANGLE);Our eighth generation TPUs: two chips for the agentic era(Google Blog);Sundar Pichai shares news from Google Cloud Next 2026(Google Blog)