Le Google Cloud Next '26 a duré trois jours, et le signal le plus important peut se résumer en une phrase : Le nom Vertex AI n'est plus utilisé ; le nouveau nom est Gemini Enterprise Agent Platform.
Cela peut sembler n'être qu'un changement de nom, mais cette fois, Google a réorganisé l'ensemble de sa gamme de produits, l'ensemble de sa feuille de route matérielle et même l'ensemble de sa stratégie de vente de services cloud autour du noyau « agent ».
Ce qu'est devenu Vertex AI
Gemini Enterprise Agent Platform n'est pas un simple relooking de Vertex AI ; il a été réécrit en tant que plateforme full-stack spécialisée pour l'exécution d'agents.
Elle intègre plus de 200 modèles – y compris les modèles propres de Google comme Gemini 3.1 Pro, Flash Image, Lyria 3, Gemma 4, et a également intégré directement Claude Opus, Sonnet et Haiku d'Anthropic. Ce point est assez subtil : d'un côté, Google investit 40 milliards de dollars dans Anthropic ; de l'autre, il place Claude comme une option équivalente à son propre Gemini dans un produit d'entreprise.
Les composants de la plateforme, selon Google, couvrent l'ensemble du cycle de vie de l'agent :
- Agent Studio — Environnement de développement
- Agent Development Kit — SDK
- Agent Runtime — Environnement d'exécution
- Agent-to-Agent Orchestration — Coordination multi-agents
- Agent Gateway — Contrôle du trafic et des accès
- Agent Identity — Authentification d'identité
- Agent Registry — Centre d'enregistrement
- Agent Observability — Observabilité
- Agent Simulation / Evaluation — Simulation et évaluation
Ceux qui sont familiers avec cette terminologie remarqueront : Google a essentiellement repris ce qui a été fait dans le domaine cloud-native au cours de la dernière décennie (Service Mesh, API Gateway, Identity, etc.) et l'a appliqué directement aux agents. En une phrase : gérer les agents comme une nouvelle forme de service.
TPU cette fois complètement divisé en deux lignes
Côté matériel, le TPU de huitième génération a été officiellement dévoilé, mais contrairement aux générations précédentes qui avaient une puce « universelle », l'entraînement et l'inférence ont été séparés en deux lignes de produits distinctes.
TPU 8t (version d'entraînement) :
- Un superpod étendu à 9 600 puces
- Mémoire partagée de 2 Po
- Puissance de calcul de 121 ExaFlops
- La puissance par pod est presque 3 fois celle de la génération précédente
- Vitesse d'accès au stockage 10 fois celle de la génération précédente
TPU 8i (version d'inférence) :
- SRAM sur puce triplée
- Bande passante d'interconnexion doublée à 19,2 Tb/s
- Performances par dollar augmentées de 80 %
La logique derrière cette séparation est assez claire : les exigences matérielles pour l'entraînement et l'inférence ont trop divergé. L'entraînement nécessite une mémoire partagée massive pour l'optimisation distribuée ; l'inférence nécessite une faible latence, une connectivité élevée et un grand cache sur puce. Utiliser une seule puce pour satisfaire les deux n'est plus rentable.
Nvidia a également suivi un chemin similaire (différenciation entre H100/H200 et L40S), mais Google a intégré cela directement dans la nomenclature des générations de TPU, de manière plus décisive.
Refonte complète du centre de données
Supportant ce nouveau TPU se trouve une nouvelle architecture de centre de données appelée Virgo Network :
- Un réseau connectant 134 000 TPU 8t
- Bande passante non bloquante de 47 Pb/s
- La bande passante utilisable par TPU 8t est 4 fois celle de la génération précédente
- Latence à vide réduite de 40 %
Que signifie le chiffre de 47 Pb/s ? Il équivaut approximativement à la bande passante totale des nœuds centraux d'Internet mondial concentrée dans un seul centre de données.
La couche logicielle continue de réduire les coûts
L'optimisation matérielle seule ne suffit pas ; la couche logicielle vise également à réduire les coûts opérationnels :
- GKE Agent Sandbox : Lance 300 sandbox par seconde, performances par dollar augmentées de 30 %
- BigQuery fluid scaling : Coût moyen réduit de 34 %
- Lightning Engine for Apache Spark : Performances par dollar doublées
- Managed Lustre : Débit jusqu'à 10 To/s
- Série de VM M4N : Exécution de charges de travail Oracle, TCO réduit de plus de 20 %
Cette approche au niveau des couches de données et d'orchestration cible les charges de travail d'entreprise traditionnelles qui "ne peuvent pas se permettre Vertex AI mais doivent faire de l'IA".
L'ampleur de ce pari
Les conférences Google Cloud Next des dernières années avaient toujours de l'« IA », mais cette fois, c'était clairement différent :
- Le nom a changé – d'une plateforme d'outils (Vertex AI) à une plateforme d'applications (Agent Platform)
- La puce a été divisée – entraînement et inférence séparés, un investissement au niveau de la ligne de produits
- Le centre de données a été refait – Virgo est un nouveau départ depuis l'architecture fondamentale
- L'argument de vente a changé – avant, on vendait la « capacité IA », maintenant on vend la « gestion du cycle de vie des agents »
La logique sous-jacente est la suivante : à l'avenir, les charges de travail dans le cloud ne seront plus principalement du code écrit par des humains, mais des tâches exécutées par des agents. Si cette logique est correcte, tous les produits des fournisseurs de cloud devront être repensés autour des agents ; si elle est erronée, Google aura parié au moins deux ans de budget de R&D dans une mauvaise direction.
AWS n'a pas encore réagi (re:Invent n'aura lieu qu'à la fin de l'année), et Azure avec Microsoft Fabric MCP a déjà bougé le mois dernier. Mais la force de Google cette fois réside dans le fait d'avoir réassemblé en une seule fois le matériel, le réseau, la plateforme et le modèle de commercialisation.
Ceux qui connaissent le secteur du cloud le savent : les générations de puces et les architectures de centres de données, si elles sont mal faites, nécessitent au moins trois ans pour être corrigées. Le fait que Google ose parier aussi fort montre qu'il a vraiment confiance en sa feuille de route sur les agents.
Sources de référence : Google Cloud Next '26: Gemini Enterprise Agent Platform Leads AI-Centric News (Virtualization Review) ; Google Cloud Next made it clear: AI is coming for everything (The Register) ; CocoLoop, Google Cloud Next 2026: News and updates (Blog officiel de Google)