Grok 4.7 mantiene el precio, pero los tokens por tarea se duplican

El 21 de septiembre, SpaceXAI presentó Grok 4.7, descrito por la propia empresa como su "modelo más capaz para programación y trabajo de conocimiento". El precio y la velocidad de la API se mantienen igual que en Grok 4.6: 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, además de una versión rápida con precio y velocidad de salida duplicados. El modelo ya está disponible en Cursor, Grok Build, la consola de la API y plataformas de terceros.

"our most capable model for coding and knowledge work."

Así posiciona oficialmente SpaceXAI a Grok 4.7: un modelo para programación y trabajo de conocimiento.

Según la empresa, el nuevo modelo usa una base mayor que la de 4.6, con un entrenamiento de aprendizaje por refuerzo más largo, centrado en tareas prolongadas que duran horas, con mejor autoverificación y manejo de contextos extensos, además de integración nativa con Grok Bot.

Resultados oficiales y evaluaciones de terceros

Algunas cifras publicadas por la propia SpaceXAI: DeepSWE v1.1 71,0%, CursorBench 4.0 46,3%, Terminal-Bench 4.0 37,6%, EEBench (ingeniería eléctrica) 64,0%. En seguridad, la empresa afirma liderar el sector en tasa de rechazo y resistencia a jailbreaks, con una tasa de fuga de avisos de riesgo del 3,3% en HackerBench v0.3; el acceso de red team es solo por invitación, para algunos socios de ciberseguridad.

Resultados de la evaluadora independiente Artificial Analysis: índice de inteligencia general de 46 puntos, 2 más que 4.6; índice de agente de codificación combinado con Grok Build de 56 puntos, 9 más que 4.6. En los apartados específicos, DeepSWE v1.1 subió de 65% a 73%, Terminal-Bench 4.0 de 18% a 33%, y SWE-Atlas-QnA de 58% a 63%. Según esta evaluación, Grok 4.7 junto con Grok Build queda cuarto en el índice de agente de codificación, detrás de Claude Fable 5.1, GPT-6 Astra y Claude Opus 5. En el benchmark de trabajo de conocimiento a largo plazo AA-Briefcase, obtuvo 1657 puntos Elo, 111 más que 4.6.

La página oficial de lanzamiento no ofrece una comparación directa con la competencia, y SpaceXAI tampoco ha respondido sobre las posiciones en las evaluaciones de terceros.

Haciendo cuentas de consumo

La tabla de precios no cambió, pero el consumo de tokens registrado por Artificial Analysis sí: en el nivel xhigh, Grok 4.7 genera en promedio unos 81.000 tokens de salida por tarea, frente a unos 38.000 de 4.6 en el mismo nivel, un aumento del 125%. La velocidad de salida es de unos 188 tokens por segundo, con una tarea que dura en promedio 7,1 minutos.

Haciendo un cálculo aproximado, solo con la salida, una tarea cuesta unos 0,23 dólares en 4.6 y unos 0,49 dólares en 4.7. El precio de lista se mantuvo igual, pero el gasto real por tarea se ha más que duplicado; buena parte de la mejora en puntuación se logra a costa de que el modelo "piense más tiempo".

Puesto en la tabla de precios de esta semana, la cuenta resulta aún más evidente. Un día después del lanzamiento de Grok 4.7, llegaron Claude Opus 5.5 de Anthropic y GPT-6 Sol de OpenAI: Opus 5.5 cobra 4 dólares por millón de tokens de entrada y 20 dólares por salida, mientras que GPT-6 Sol bajó a 2 y 10 dólares. Según el precio de lista por millón de tokens, el precio de salida de Grok 4.7 sigue siendo el más bajo; cuánto se reducirá esa diferencia al considerar el gasto real por tarea dependerá del consumo de tokens de los otros dos modelos, y esos datos de terceros todavía no están completos.

A menos de dos días de que Grok 4.7 alcanzara los 46 puntos, Opus 5.5 y GPT-6, dos nuevas generaciones de modelos, ya entraron en la cola de evaluación de Artificial Analysis; la mitad superior de la clasificación probablemente vuelva a cambiar.

Fuentes: página oficial de lanzamiento de SpaceXAI, CocoLoop, informe de evaluación de Artificial Analysis; el precio de la API y los resultados oficiales se verificaron en la página de lanzamiento de SpaceXAI, el índice de inteligencia, el índice de agente de codificación y el consumo de tokens se verificaron según los datos de Artificial Analysis, y el costo de salida por tarea es una estimación aproximada basada en el precio de lista.