DeepInfra a annoncé le 4 mai une levée de 107 millions de dollars en Série B. Le montant n'est pas le plus spectaculaire dans l'infrastructure IA, mais la liste des investisseurs est parlante.
Le tour a été mené par 500 Global, avec la participation de Nvidia Corp., Samsung Next, Supermicro, A.Capital, Felicis, Peak6, Upper90 et Georges Harik, l'un des premiers ingénieurs de Google.
Voir Nvidia investir directement dans une startup indépendante de "cloud d'inférence" aurait été rare il y a encore quelques années. À l'époque, l'inférence était largement absorbée par les grandes plateformes cloud. En 2026, Nvidia commence à financer une couche indépendante d'infrastructure d'inférence, signe que cette couche est devenue un marché à part entière.
Où en est DeepInfra
Le CEO de DeepInfra, Nikola Borisov, a résumé l'enjeu dans l'annonce:
"Inference is no longer a thin layer - it's the system constraint that will define the majority of workloads."
Autrement dit, l'inférence n'est plus une mince couche d'API. Elle devient le goulot d'étranglement système qui déterminera une grande partie des charges de travail à venir.
- Plus de 190 modèles d'IA ouverts sont pris en charge, dont Llama, Qwen, DeepSeek et Mistral.
- Plus de 30% du débit de tokens provient de charges d'agents, c'est-à-dire d'autonomous agents plutôt que de simples conversations.
- Huit centres de données aux États-Unis exploitent une infrastructure GPU détenue en propre, avec la plateforme d'inférence distribuée Nvidia Dynamo.
- Le parc GPU comprend Blackwell et Vera Rubin. Vera Rubin vient seulement d'entrer en production de masse cette année, ce qui rend la relation avec Nvidia difficile à ignorer.
- L'entreprise indique aussi traiter 5 000 milliards de tokens par semaine, avoir multiplié son volume de tokens par 25 depuis la Série A et triplé son chiffre d'affaires depuis le début de 2026.
Le chiffre de 30% est le plus important. Les workflows d'agents ne ressemblent pas aux chatbots. Une seule tâche peut appeler une centaine d'outils et déclencher des dizaines de requêtes API. C'est une charge quasiment toujours active, pas un service qui démarre seulement quand l'utilisateur tape une phrase. Les clouds traditionnels ne sont pas optimisés pour ce profil: modèles de facturation, hypothèses de cold start et algorithmes d'ordonnancement ont été conçus pour des boucles d'interaction humaine.
Pourquoi posséder ses GPU devient un avantage
Le coeur de cette levée tient en une idée simple: DeepInfra ne loue pas les GPU d'AWS; l'entreprise achète et exploite sa propre capacité.
Ces dernières années, la norme pour exécuter l'inférence IA consistait à louer des services GPU chez AWS, GCP ou Azure. Le problème est que ces trois acteurs vendent aussi leurs propres API de modèles, maintiennent des prix élevés et conservent de la latence liée au cold start. Together, Fireworks, Groq et DeepInfra ont progressé ensemble ces deux dernières années parce qu'ils ont attaqué ce décalage.
DeepInfra revendique une amélioration de 20 fois de l'efficacité des coûts. Le chiffre doit être lu avec prudence, car tout dépend du point de comparaison. Mais pour les équipes qui exploitent des modèles ouverts à grande échelle, par exemple des produits avec des millions d'utilisateurs actifs mensuels, passer à un cloud d'inférence spécialisé peut souvent réduire la facture de plus de moitié.
Comment se structure le cloud d'inférence
| Entreprise | Positionnement |
|---|---|
| Together AI | Plateforme full-stack avec une alternative maison à CUDA |
| Fireworks AI | Fortement liée à l'écosystème Hugging Face |
| Groq | Spécialiste des puces LPU, remarqué par Nvidia et AMD |
| Cerebras | Puces wafer-scale géantes et trajectoire vers les marchés publics |
| DeepInfra | Huit centres de données opérés en propre, plus de 190 modèles ouverts et un focus sur les agents |
DeepInfra n'a pas la valorisation la plus visible du groupe, mais son positionnement est clair: l'infrastructure d'inférence pour les modèles ouverts. L'entreprise ne revend pas des modèles fermés et ne cherche pas à se battre au niveau de la couche modèle. La comparaison la plus proche est Together, avec une différence importante: DeepInfra garde un contrôle plus serré de la pile, des GPU à l'ordonnancement jusqu'à l'API.
Les agents sont le vrai pari
La phrase de Borisov sur l'inférence comme contrainte système n'est pas seulement un slogan.
Quand les workflows d'agents deviennent courants, chaque utilisateur peut déclencher des dizaines d'inférences par minute en arrière-plan. Cursor qui écrit du code, Claude Code qui modifie des fichiers ou Agentforce de Salesforce qui traite des tickets n'ont pas le même profil de charge qu'un échange de type ChatGPT, où l'utilisateur pose une question et le modèle répond une fois.
Le fournisseur capable de maintenir une faible latence p99, de contenir les coûts et de garantir une rétention zéro des données dans ce contexte aura un avantage net auprès des entreprises.
Dans le discours de cette nouvelle levée, DeepInfra mentionne "agentic workloads" plus souvent que lors des tours précédents. Dans l'année qui vient, ce marché ne se jouera pas seulement sur la largeur du catalogue de modèles, mais sur la capacité de l'infrastructure à encaisser des milliers d'agents appelant l'inférence en même temps.
Le fait que Nvidia investisse directement suggère qu'elle pense que ce moment approche réellement.
Sources: DeepInfra Closes $107M Series B to Power Production-Scale AI Inference (GlobeNewswire); Deepinfra lands $107M in funding to build out its dedicated inference cloud for open-source models (SiliconANGLE); CocoLoop; DeepInfra Raises $107M Series B to Scale Inference Infrastructure (DeepInfra Blog)