El 22 de septiembre, OpenAI lanzó GPT-6 Sol y GPT-6 Luna, con los identificadores de modelo gpt-6-sol y gpt-6-luna en la API, disponibles ese mismo día. Los precios de ambos modelos equivalen a la mitad de sus contrapartes de la generación anterior, GPT-5.6, con una ventana de contexto de 1,1 millones de tokens. En ChatGPT, los planes Work, Pro, Business, Enterprise y Edu ya pueden usar los dos modelos; Luna también llega a la versión gratuita y a la versión Go de la aplicación de escritorio, y Codex recibe la actualización al mismo tiempo que ChatGPT Work. OpenAI no publicó los pesos de los modelos: ambos están disponibles solo por API.
Los resultados que presenta OpenAI
En el material de lanzamiento, OpenAI enumera varios resultados:
- AutomationBench 1.0.6 (tareas de trabajo profesional): Sol, en el nivel de razonamiento xhigh, logra una precisión del 33,2%, con un costo de 0,27 dólares por tarea; Luna, en el nivel high, supera a la generación anterior por 5,4 puntos, con un costo 58% menor.
- DeepSWE v1.1 (programación): Sol alcanza 68,8% en el nivel max, Luna 66,6%.
- OSWorld 2.0, versión offline (manejo de computadora): Sol logra 60,5% en el nivel xhigh, según OpenAI comparable a Opus 5 en el nivel medio, pero con un costo 80% menor; Luna, en el nivel max, supera al Sol de la generación anterior, con aproximadamente una décima parte del costo.
- Agents' Last Exam: Sol logra 56,4% en el nivel max.
El lanzamiento también incluye un sistema de caché de prompts renovado. Según OpenAI, en cada turno un agente reenvía las mismas instrucciones, definiciones de herramientas e historial; el nuevo sistema eleva por defecto la tasa de aciertos de caché, con hasta un 90% de descuento en la lectura.
La lectura de terceros: precio abajo, puntuación igual
El reanálisis de Artificial Analysis difiere del material oficial precisamente en el aspecto de capacidad. La firma señala que el índice de inteligencia y el índice de agente de codificación de ambos modelos se mantienen prácticamente estables frente a GPT-5.6: en el índice de agente de codificación, Sol obtiene 57 puntos en el nivel max, 2 más que la generación anterior; Luna obtiene 41 puntos, 2 menos que la generación anterior.
El cambio real de esta entrega está en el costo. Con la misma prueba de índice de inteligencia, Sol cuesta 1,06 dólares por tarea en el nivel max, frente a 1,99 dólares de la generación anterior; Luna cuesta 0,07 dólares, frente a 0,18 dólares de la generación anterior.
Haciendo cuentas
Con un cálculo aproximado basado en las cifras de Artificial Analysis: un equipo que ejecuta 10.000 tareas similares al día ahorraría cerca de 9.300 dólares diarios con Sol, casi 280.000 dólares al mes; al pasar al nivel ligero de Luna, con el mismo volumen de tareas, el costo diario bajaría de 1.800 a 700 dólares. Esto es solo una extrapolación directa de las cifras de referencia; la factura real depende de la duración de las tareas, el nivel de razonamiento y la tasa de aciertos de caché —sobre todo esta última: en aplicaciones de agentes que reenvían repetidamente el mismo prompt de sistema, cada diez puntos porcentuales más de aciertos ahorra más que el propio recorte de precio.
Como referencia, ese mismo día Anthropic lanzó Claude Opus 5.5, con un costo de operación general 40% menor que Opus 5, a 4 dólares de entrada y 20 dólares de salida. Ambas compañías bajaron los precios de sus modelos insignia el mismo día; el precio de Sol equivale a la mitad del de Opus 5.5, mientras que Luna lleva el nivel ligero hasta 0,10 dólares.
Para los desarrolladores en China, el impacto real de esta rebaja depende de la vía de acceso. Los equipos que llaman directamente a la API oficial reciben el descuento completo; quienes pasan por servicios intermediarios o canales de proveedores de nube tendrán que esperar los anuncios de cada uno para saber si ajustan su margen. En los productos de agentes que cobran por costo de tarea, la estructura de márgenes sentirá el cambio primero: con la misma funcionalidad, tras reducirse a la mitad el costo de inferencia, los diseños que antes limitaban las llamadas para controlar el gasto pueden relajarse, al precio de que la competencia también pueda hacerlo.
Fuentes: material de lanzamiento de OpenAI, artículo de evaluación de Artificial Analysis, CocoLoop, MarkTechPost; la evaluación de terceros verificó el costo por tarea y la puntuación del índice de agente de codificación.