El proveedor de inferencia Fireworks AI lanzó Ember-1, construido sobre el modelo de pesos abiertos Kimi K3 de Moonshot AI. Fireworks no modificó la arquitectura del modelo, solo aplicó un post-entrenamiento con un objetivo único: que K3 "piense" menos y responda con la misma calidad. Según la compañía, esto reduce en aproximadamente un 40% los tokens generados, prácticamente sin pérdida de calidad.
Por ahora, Ember-1 está disponible como vista previa de investigación (research preview) en Fireworks Serverless, accesible solo mediante API, sin pesos ni código de entrenamiento publicados y sin posibilidad de auto-alojamiento. El precio es el mismo que el de K3 en Fireworks: 3 dólares por millón de tokens de entrada, 0,30 dólares por tokens de entrada en caché y 15 dólares por tokens de salida.
El ahorro viene sobre todo de "pensar"
Fireworks explicó la motivación en su blog: a los usuarios les gusta la capacidad de programación de K3, pero su cadena de razonamiento es demasiado larga, lo que dificulta reducir costos en flujos de programación automatizados. Según sus propios datos, en modelos de razonamiento como K3 a veces más del 90% de la salida se destina al razonamiento interno antes de responder; cuando un agente llama herramientas paso a paso, el modelo vuelve a "pensar" lo ya pensado en cada paso anterior.
Bajar el nivel de reasoning effort de K3 sería la solución más directa, y Fireworks dice haberlo probado: en niveles bajos la calidad caía demasiado. Ember-1 sigue otro camino; en palabras de la compañía:
"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."
Ember-1 es K3 post-entrenado para razonar con menos tokens, no para ejecutarse con un nivel de esfuerzo más bajo.
El entrenamiento cubrió matemáticas, programación, seguimiento de instrucciones, diálogo, búsqueda, llamadas a herramientas e ingeniería de software, con más de 50 experimentos de entrenamiento y más de 200 evaluaciones, todo ejecutado en su propia infraestructura Serverless Training y con datos propios. Sobre el algoritmo exacto, Fireworks solo dice que es un método nuevo, aún no publicado, por lo que de momento no puede reproducirse externamente.
Resultados de benchmark: unos suben, otros bajan
Fireworks comparó Ember-1 con tres niveles de K3:
| Benchmark | K3 bajo | K3 alto | K3 Max | Ember-1 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 76,4% | 77,6% | 80,9% | 82,0% |
| SWE-bench Verified | 80,4% | 86,0% | 93,2% | 92,2% |
| DeepSWE 1.1 | 55,8% | 62,8% | 66,4% | 75,2% |
En DeepSWE, Ember-1 supera a K3 Max por casi 9 puntos porcentuales, pero en SWE-bench Verified queda 1 punto por debajo. Según datos citados por medios externos, en SWE-Interact Ember-1 también queda ligeramente por debajo de K3 Max. Todo esto son pruebas internas de Fireworks, todavía sin revisión de un organismo de evaluación independiente.
Más convincentes son los datos en producción real. Fireworks realizó pruebas A/B con dos clientes sobre tráfico real de programación, con una caída general de alrededor del 35% en tokens por tarea. El conjunto de datos más completo muestra: los tokens de razonamiento bajaron un 71,3%, los tokens totales un 39%, y la puntuación de la tarea fue de 0,753 frente a 0,751. Un cliente ya puso Ember-1 en producción; el nombre de la empresa no se ha revelado.
Una cuenta rápida
Como el precio por token es el mismo, el ahorro proviene enteramente de generar menos texto. Con base en esos datos A/B, el costo de salida por tarea de K3 Max ronda los 0,74 dólares, y el de Ember-1 unos 0,45 dólares. Un equipo que ejecuta 10.000 tareas de programación al día vería su costo diario de salida bajar de unos 7.400 a unos 4.500 dólares, una diferencia de más de 80.000 dólares al mes. Esta estimación solo contempla la salida, sin contar entrada ni caché; el ahorro real depende de la duración de las tareas.
Para los desarrolladores en China, el significado de Ember-1 está más en el método que en el producto en sí. K3 es un modelo de pesos abiertos que cualquiera puede post-entrenar, y Fireworks demostró que "comprimir la longitud del razonamiento" puede venderse como un producto propio. Los proveedores de inferencia chinos también tienen en sus manos modelos abiertos como K3, DeepSeek y Qwen, así que vale la pena observar si surgen "versiones de ahorro de tokens" similares. El propio Ember-1, para uso desde China, debe pasar por una API en el extranjero, por lo que la latencia y el cumplimiento normativo deben evaluarse aparte.
Fuentes: blog oficial de Fireworks AI, MarkTechPost, CocoLoop, página de modelos de Fireworks; se verificaron las tres puntuaciones de benchmark, los datos de tokens y puntuación de las pruebas A/B, y los precios de entrada/salida por millón de tokens.