DeepInfra anunció el 4 de mayo una ronda Serie B de 107 millones de dólares. No es la mayor cifra dentro de la infraestructura de IA, pero la lista de inversores dice bastante.
La ronda fue liderada por 500 Global, con participación de Nvidia Corp., Samsung Next, Supermicro, A.Capital, Felicis, Peak6, Upper90 y Georges Harik, uno de los primeros ingenieros de Google.
Que Nvidia invierta directamente en una startup independiente de "nube de inferencia" habría sido poco común hace apenas unos años. Entonces, la inferencia quedaba absorbida en gran medida por las grandes plataformas cloud. En 2026, Nvidia empieza a poner capital en una capa independiente de infraestructura de inferencia, señal de que esa capa ya se ha convertido en un mercado propio.
En qué punto está DeepInfra
El CEO de DeepInfra, Nikola Borisov, lo expresó de forma directa en el anuncio:
"Inference is no longer a thin layer - it's the system constraint that will define the majority of workloads."
Dicho de otra forma, la inferencia ya no es una fina capa de API. Se está convirtiendo en el cuello de botella del sistema que definirá buena parte de las próximas cargas de trabajo.
- Soporta más de 190 modelos de IA abiertos, incluidos Llama, Qwen, DeepSeek y Mistral.
- Más del 30% del throughput de tokens procede de cargas de agentes, es decir, autonomous agents, no de chat convencional.
- Ocho centros de datos en Estados Unidos operan infraestructura propia de GPU sobre la plataforma de inferencia distribuida Nvidia Dynamo.
- La mezcla de GPU incluye Blackwell y Vera Rubin. Vera Rubin acaba de entrar en producción a gran escala este año, lo que hace difícil pasar por alto la relación con Nvidia.
- La compañía también afirma procesar 5 billones de tokens por semana, haber multiplicado por 25 el volumen de tokens desde la Serie A y haber triplicado los ingresos desde el inicio de 2026.
El dato más relevante es ese 30%. Los flujos de trabajo de agentes no se comportan como un chatbot. Una sola tarea puede invocar un centenar de herramientas y lanzar decenas de llamadas API. Es una carga siempre activa, no algo que empieza solo cuando el usuario escribe una frase. Las nubes tradicionales no fueron diseñadas para ese perfil: sus modelos de facturación, supuestos de cold start y algoritmos de planificación nacieron para ciclos de interacción humana.
Por qué tener GPU propias se volvió una ventaja
El núcleo de esta ronda es sencillo: DeepInfra no alquila GPU de AWS; compra y opera su propia capacidad.
Durante los últimos años, la forma estándar de ejecutar inferencia de IA era alquilar servicios de GPU de AWS, GCP o Azure. El problema es que esas tres compañías también venden sus propias API de modelos, mantienen precios altos y arrastran latencia de cold start. Together, Fireworks, Groq y DeepInfra crecieron en paralelo durante los dos últimos años porque atacaron ese desajuste.
DeepInfra habla de una mejora de 20 veces en eficiencia de costes. Es una cifra que necesita contexto, porque depende mucho del punto de comparación. Pero para equipos que ejecutan modelos abiertos a gran escala, por ejemplo productos con millones de usuarios activos mensuales, pasar a una nube de inferencia especializada puede reducir la factura a menos de la mitad con relativa frecuencia.
Cómo se ordena el mercado de nube de inferencia
| Compañía | Rasgo principal |
|---|---|
| Together AI | Plataforma full-stack con alternativa propia a CUDA |
| Fireworks AI | Fuerte vínculo con el ecosistema Hugging Face |
| Groq | Chips LPU dedicados, observados por Nvidia y AMD |
| Cerebras | Chips wafer-scale gigantes y camino hacia los mercados públicos |
| DeepInfra | Ocho centros de datos propios, más de 190 modelos abiertos y foco en agentes |
DeepInfra no tiene la valoración más llamativa del grupo, pero su posición es clara: infraestructura de inferencia para modelos abiertos. No actúa como intermediario de modelos cerrados ni compite en la capa de modelos. Se parece sobre todo a Together, con una diferencia importante: DeepInfra conserva más control del stack, desde las GPU hasta la planificación y la API.
Los agentes son la apuesta real
La frase de Borisov sobre la inferencia como restricción del sistema no es solo una línea de marketing.
Cuando los flujos de agentes se vuelvan habituales, cada usuario puede activar decenas de inferencias por minuto en segundo plano. Cursor escribiendo código, Claude Code modificando archivos o Agentforce de Salesforce gestionando tickets tienen un perfil de carga muy distinto al de ChatGPT, donde el usuario pregunta una vez y el modelo responde una vez.
El proveedor que logre mantener baja la latencia p99, controlar costes y garantizar cero retención de datos en ese entorno tendrá una ventaja clara para cerrar contratos empresariales.
En el lenguaje de esta nueva financiación, DeepInfra menciona "agentic workloads" más que en rondas anteriores. Durante el próximo año, este mercado no se decidirá solo por quién tenga el catálogo de modelos más amplio, sino por quién pueda sostener una infraestructura en la que miles de agentes llamen a inferencia al mismo tiempo.
La inversión de Nvidia sugiere que la compañía cree que ese momento puede estar llegando de verdad.
Fuentes: DeepInfra Closes $107M Series B to Power Production-Scale AI Inference (GlobeNewswire); Deepinfra lands $107M in funding to build out its dedicated inference cloud for open-source models (SiliconANGLE); CocoLoop; DeepInfra Raises $107M Series B to Scale Inference Infrastructure (DeepInfra Blog)