Google biến Vertex AI thành nền tảng Agent

Google Cloud Next '26 kéo dài ba ngày, và tín hiệu lớn nhất thực chất chỉ gói gọn trong một câu: Cái tên Vertex AI không còn được sử dụng nữa, tên mới là Gemini Enterprise Agent Platform.

Nghe có vẻ chỉ là đổi tên, nhưng lần này Google đã sắp xếp lại toàn bộ dòng sản phẩm, toàn bộ lộ trình phần cứng, và thậm chí toàn bộ cách bán dịch vụ đám mây xoay quanh cốt lõi "agent".

Vertex AI đã trở thành gì

Gemini Enterprise Agent Platform không phải là sự thay da đổi thịt đơn giản của Vertex AI, mà đã được viết lại thành một nền tảng full-stack chuyên chạy agent.

Bên trong nó tích hợp hơn 200 mô hình – bao gồm các mô hình nội bộ của Google như Gemini 3.1 Pro, Flash Image, Lyria 3, Gemma 4, và cũng trực tiếp tích hợp Claude Opus, Sonnet, Haiku của Anthropic. Điểm này khá tinh tế: một mặt Google đầu tư 40 tỷ USD vào Anthropic, mặt khác đặt Claude ngang hàng với Gemini trong sản phẩm doanh nghiệp.

Các thành phần của nền tảng, theo Google, bao phủ toàn bộ vòng đời agent:

  • Agent Studio — Môi trường phát triển
  • Agent Development Kit — SDK
  • Agent Runtime — Môi trường chạy
  • Agent-to-Agent Orchestration — Phối hợp nhiều agent
  • Agent Gateway — Kiểm soát lưu lượng và truy cập
  • Agent Identity — Xác thực danh tính
  • Agent Registry — Trung tâm đăng ký
  • Agent Observability — Khả năng quan sát
  • Agent Simulation / Evaluation — Mô phỏng và đánh giá

Những ai quen thuộc với các thuật ngữ này sẽ nhận ra: Google về cơ bản đã áp dụng nguyên xi những gì đám mây gốc đã làm trong thập kỷ qua (Service Mesh, API Gateway, Identity, v.v.) vào agent. Nói một câu: quản lý agent như một dạng dịch vụ mới.

TPU lần này hoàn toàn tách thành hai dòng

Về phần cứng, TPU thế hệ thứ 8 chính thức được công bố, nhưng không giống các thế hệ trước chỉ có một chip "đa năng", mà tách training và inference thành hai dòng sản phẩm riêng biệt.

TPU 8t (bản training):

  • Một superpod mở rộng lên 9.600 chip
  • Bộ nhớ dùng chung 2 PB
  • Sức mạnh tính toán 121 ExaFlops
  • Sức mạnh mỗi pod gấp gần 3 lần thế hệ trước
  • Tốc độ truy cập lưu trữ gấp 10 lần thế hệ trước

TPU 8i (bản inference):

  • SRAM trên chip tăng gấp ba
  • Băng thông kết nối tăng gấp đôi lên 19,2 Tb/s
  • Hiệu suất trên mỗi đô la tăng 80%

Sự phân tách này dựa trên nhận định khá rõ ràng: nhu cầu phần cứng cho training và inference đã phân nhánh quá lớn. Training cần bộ nhớ dùng chung siêu lớn để tối ưu hóa phân tán, inference cần độ trễ thấp, kết nối cao, bộ nhớ đệm trên chip lớn. Dùng một chip để phục vụ cả hai không còn hiệu quả.

Nvidia cũng đã đi qua con đường tương tự (sự phân hóa giữa H100/H200 và L40S), nhưng Google đưa điều này vào tên thế hệ TPU một cách dứt khoát hơn.

Thiết kế lại toàn bộ trung tâm dữ liệu

Hỗ trợ cho TPU mới này là một kiến trúc trung tâm dữ liệu mới có tên Virgo Network:

  • Một mạng lưới kết nối 134.000 chip TPU 8t
  • Băng thông không chặn 47 Pb/s
  • Băng thông mỗi chip TPU 8t có thể sử dụng gấp 4 lần thế hệ trước
  • Độ trễ khi không tải giảm 40%

Con số 47 Pb/s có ý nghĩa gì? Nó tương đương với việc nhồi nhét tổng băng thông của các nút lõi internet toàn cầu vào một trung tâm dữ liệu duy nhất.

Lớp phần mềm vẫn đang cắt giảm chi phí

Chỉ cải tiến phần cứng thôi chưa đủ, lớp phần mềm lần này cũng tập trung cắt giảm chi phí vận hành:

  • GKE Agent Sandbox: Khởi động 300 sandbox mỗi giây, hiệu suất trên mỗi đô la tăng 30%
  • BigQuery fluid scaling: Chi phí trung bình giảm 34%
  • Lightning Engine for Apache Spark: Hiệu suất trên mỗi đô la tăng gấp đôi
  • Managed Lustre: Thông lượng lên đến 10 TB/s
  • Dòng máy ảo M4N: Chạy khối lượng công việc Oracle, TCO giảm hơn 20%

Cách tiếp cận ở lớp dữ liệu và điều phối này nhắm vào các khối lượng công việc truyền thống của doanh nghiệp "không đủ khả năng chi trả cho Vertex AI nhưng vẫn phải làm AI".

Nước cờ này lớn đến mức nào

Các hội nghị Google Cloud Next những năm trước đều có "AI", nhưng lần này rõ ràng khác biệt:

  • Tên gọi thay đổi – từ nền tảng công cụ (Vertex AI) thành nền tảng ứng dụng (Agent Platform)
  • Chip bị tách – training và inference phân chia, là một sự đầu tư ở cấp độ dòng sản phẩm
  • Trung tâm dữ liệu được thiết kế lại – Virgo là sự khởi đầu lại từ kiến trúc nền tảng
  • Điểm bán hàng thay đổi – trước đây bán "năng lực AI", bây giờ bán "quản lý vòng đời agent"

Nhận định đằng sau điều này là: trong tương lai, khối lượng công việc trên đám mây không còn chủ yếu là mã do con người viết, mà là các tác vụ do agent chạy. Nếu nhận định này đúng, thì tất cả sản phẩm của các nhà cung cấp đám mây cần được thiết kế lại xoay quanh agent; nếu sai, Google đã đặt cược ít nhất hai năm nghiên cứu và phát triển vào một hướng đi sai lầm.

AWS vẫn chưa ra đòn (re:Invent phải đợi đến cuối năm), còn Azure với Microsoft Fabric MCP đã có động thái từ tháng trước. Nhưng điểm mạnh của Google lần này là đã sắp xếp lại toàn bộ phần cứng, mạng lưới, nền tảng và mô hình thương mại hóa trong một lần.

Những ai quen thuộc với ngành đám mây đều biết: thế hệ chip và kiến trúc trung tâm dữ liệu, nếu làm sai thì phải mất ba năm mới quay đầu lại được. Google dám đặt cược như vậy, chứng tỏ họ thực sự tin tưởng vào lộ trình agent của mình.

Nguồn tham khảo: Google Cloud Next '26: Gemini Enterprise Agent Platform Leads AI-Centric News (Virtualization Review); Google Cloud Next made it clear: AI is coming for everything (The Register); CocoLoop, Google Cloud Next 2026: News and updates (Blog chính thức của Google)