El proveedor de inferencia Baseten publicó el 2 de octubre una entrada técnica: usando Claude Code para dirigir a Fable 5, dejaron que un agente escribiera desde cero un motor de inferencia dedicado a un solo modelo, que superó a vLLM en todos los patrones de tráfico probados.
El motor se llama VibeQwen y está hecho a medida para el Qwen-3.6-35B-A3B de Alibaba. El autor, Shawn Rushefsky, escribe en el texto:
"the generated engine, called VibeQwen, outperformed vLLM across all tested traffic patterns, and by very large margins in some cases"
(El motor generado, llamado VibeQwen, superó a vLLM en todos los patrones de tráfico probados, y por márgenes muy amplios en algunos casos.)
De dónde salen los números
El hardware de prueba fue una Nvidia B200, el grupo de comparación fue vLLM 0.25.1, y la herramienta de carga fue AIPerf. Algunos resultados:
- Decodificación de un solo flujo a 1792 TPS frente a 943 TPS de vLLM, alrededor de 90% más rápido;
- La latencia hasta el primer token cae de 28 a 12 milisegundos, unas 2,3 veces;
- Con 32 solicitudes concurrentes, el throughput es 71% mayor.
En cuanto al costo, VibeQwen tardó alrededor de una semana, consumió unos 1700 millones de tokens (la mayoría en caché), unas 200 horas de B200, con un costo total del orden de unos pocos miles de dólares.
Baseten probó el mismo método también en segmentación de imágenes. El segundo resultado se llama Sammie, sirve al SAM 3.1 de Meta, corre en H100, se completó en pocos días, costó algunos cientos de dólares y unos 200 millones de tokens. Con 32 solicitudes concurrentes, el throughput fue 50% mayor que el del servidor de referencia oficial de Meta, alcanzando 91 imágenes por segundo.
Qué hizo realmente el agente
Baseten amplió su propio framework, llamado MetaInfer, hasta convertirlo en una pila de servicio completa, y dejó que el agente la fuera completando. El agente podía consultar soluciones de código abierto existentes como referencia, medía con AIPerf después de cada ronda de cambios y decidía el siguiente paso según los números.
Una restricción está escrita de forma muy concreta: cualquier cambio que pudiera afectar la precisión de la salida obligaba al agente a detenerse y pedir aprobación humana. Las desviaciones numéricas sutiles son lo más difícil de detectar en un motor de inferencia; si la ganancia de velocidad se logra a costa de la precisión, eso no se refleja en la tabla de benchmarks — esa es justo la puerta que bloquea esta restricción.
El propio artículo marca límites. VibeQwen y Sammie siguen siendo experimentos y no han servido tráfico de producción. La comparación de Sammie es aún más tosca, y el autor admite que esos números solo valen como "evidencia sugerente": arquitecturas distintas, aceleradores distintos, sin una prueba controlada.
Qué significa esto para los equipos en China
El objetivo de VibeQwen es el modelo de código abierto Qwen, y muchos servicios en producción en China casualmente también corren sobre la combinación de Qwen con vLLM o SGLang, así que estos números están directamente relacionados con el trabajo diario de no pocos equipos.
Se puede comparar la economía de los dos enfoques. Un motor de propósito general tiene que atender a cientos de arquitecturas de modelos, por lo que muchas optimizaciones agresivas para una sola arquitectura no se pueden aplicar; un motor dedicado se enfoca en un solo modelo y puede ajustar por completo los kernels de atención, el enrutamiento de MoE y la estrategia de scheduling según la forma exacta del 35B-A3B. Antes, escribir un motor dedicado requería que un equipo trabajara varios meses; esta vez Baseten lo comprimió a una semana y unos pocos miles de dólares, lo que, a grandes rasgos, resulta más barato que un mes de trabajo de un ingeniero de inferencia.
Las limitaciones también son evidentes:
- El motor queda atado al modelo. Si Qwen se actualiza con cambios de arquitectura, el motor probablemente tendrá que regenerarse.
- Las pruebas solo cubrieron la B200. Los modelos de GPU disponibles en China varían mucho, y el artículo no aporta datos sobre si el mismo proceso se puede reproducir en otros aceleradores.
- La estabilidad de cola larga, la fragmentación de memoria y el manejo de solicitudes anómalas que exige la producción pueden no estar cubiertos por los benchmarks.
Aun así, el enfoque de "cada modelo principal con su propio motor dedicado generado automáticamente" ya cuenta con una muestra verificable. Que el papel de vLLM pase de "pilar de producción" a "línea base y respaldo" dependerá de que algún equipo lleve este tipo de motor de verdad a producción y publique datos durante varios meses.
Fuentes: blog de ingeniería de Baseten, CocoLoop; TPS, latencia hasta el primer token, throughput en concurrencia, consumo de tokens y horas de GPU verificados a través del blog de Baseten.