MiniMax M2.7 itera 100 veces por sí mismo, rendimiento sube un 30%

El término "autoevolución de la IA" se usa en exceso, pero lo que MiniMax ha hecho con el M2.7 es un poco diferente.

No se trata de autoconciencia en el sentido de la ciencia ficción, sino de que el M2.7, durante su propio proceso de entrenamiento, utiliza un framework de agente para ejecutar automáticamente experimentos, leer registros, analizar métricas, ajustar código y volver a ejecutar el experimento, en un ciclo de más de 100 rondas — sin intervención humana, y las métricas de evaluación internas finalmente aumentaron un 30%.

¿Dónde están los límites de esto? ¿Es la participación de los grandes modelos en su propia iteración una dirección futura para el desarrollo de la IA, o es solo una operación inteligente desde el punto de vista de la ingeniería?

El mecanismo específico de la "autoevolución"

El framework que utiliza el M2.7 se llama OpenClaw. Durante el entrenamiento, se acopla un harness de agente de investigación, cuyas tareas son:

  • Monitorear el progreso del experimento
  • Activar automáticamente la lectura de registros y el análisis de métricas
  • Generar código de corrección al detectar problemas
  • Enviar la corrección y volver a ejecutar el experimento

Este ciclo no es diseñado paso a paso por humanos; el agente decide el siguiente paso basándose en los resultados del experimento. Después de más de 100 rondas, la evaluación interna fue un 30% superior a la original.

MiniMax llama a esto "Ecos Tempranos de la Autoevolución" (Early Echoes of Self-Evolution) — un nombre humilde, pero la dirección es significativa. Los ingenieros no necesitan monitorear cada experimento para ajustar parámetros manualmente; el modelo, en cierta medida, ha aprendido a mejorarse a sí mismo.

¿Cómo es el rendimiento del M2.7?

Primero, la capacidad de programación, que es la dimensión de comparación más directa actualmente:

Benchmark Puntuación M2.7 Observación
SWE-Pro 56,22% Cercano al nivel de Claude Opus
VIBE-Pro (entrega de proyecto de extremo a extremo) 55,6%
Terminal Bench 2 (comprensión de sistemas complejos) 57,0%

La capacidad de competencia en ML tampoco es baja: en 22 tareas de competencia de ML (MLE Bench Lite), el mejor resultado fue 9 oros, 5 platas y 1 bronce, con una tasa media de medallas del 66,6% en tres ejecuciones.

En capacidad de trabajo general, el GDPval-AA ELO es 1495, el más alto entre los modelos de código abierto actualmente. La precisión en la ejecución de habilidades complejas (cada habilidad definida con más de 2000 tokens) alcanza el 97%.

Pruebas independientes de Dataconomy también muestran que el M2.7 se acerca al GPT-5.3-Codex en tareas de ingeniería de software, y considerando la diferencia de precio, esta comparación es bastante significativa.

Arquitectura: 230B parámetros, solo se activan 10B

El M2.7 utiliza una arquitectura MoE (Mezcla de Expertos) dispersa, con un total de 230 mil millones (230B) de parámetros — pero en cada inferencia, solo se activan 10B parámetros.

Esta es la lógica clásica de MoE: dividir el modelo en muchos expertos, llamando solo a los más relevantes para la tarea actual. El resultado es: el costo de inferencia es cercano al de un modelo denso de 10B, pero la capacidad se acerca al nivel de 230B.

Precios: entrada $0,30/M token, salida $1,20/M token. También hay una versión M2.7-highspeed, más rápida y con resultados consistentes. Los pesos del modelo se publicaron como código abierto el 12 de abril.

Native Agent Teams: La colaboración multiagente no depende solo del prompting

El M2.7 tiene un punto de diseño especial: colaboración multiagente nativa (Native Agent Teams).

Según MiniMax, en escenarios multiagente, algunas capacidades no se pueden resolver solo con prompting: límites de roles, razonamiento adversarial, cumplimiento de protocolos, diferencias de comportamiento — estas deben consolidarse a nivel de entrenamiento, y solo los prompts del sistema no son suficientes.

Esta es también la razón por la que el M2.7 alcanzó un 46,3% en Toolathon (evaluación de llamada a herramientas) y admite más de 40 habilidades complejas. En la hoja de ruta de productos a largo plazo de MiniMax, la capacidad de agente es la dirección central, y el M2.7 es el paso más avanzado en este camino.

Esta dirección merece una consideración seria

La iteración automatizada del entrenamiento no es un concepto nuevo, pero el M2.7 lo ha incorporado en un modelo comercial lanzado oficialmente, con cifras concretas que lo respaldan (mejora del 30%, 100 iteraciones), en lugar de quedarse solo en el nivel de artículos académicos.

Lo que es más digno de reflexión es la pregunta que abre: si los modelos pueden mejorar su propio proceso de entrenamiento, ¿disminuirá el número de ingenieros en los laboratorios de IA en el futuro? MiniMax ya es conocida por ser un equipo pequeño pero eficiente, y el enfoque de automatización del M2.7 está perfectamente alineado con ese ADN.

Entre los modelos de código abierto chinos, el M2.7 es actualmente el que cubre más ampliamente las capacidades agentic — desde la colaboración multiagente, las competencias de ML, hasta la entrega de proyectos de extremo a extremo, todos con datos de respaldo. A diferencia de DeepSeek, que sigue la ruta de la eficiencia del entrenamiento, y de Qwen, que sigue la ruta de la escala de parámetros, MiniMax esta vez apuesta claramente a que los flujos de trabajo agentic serán el próximo campo de batalla principal.

Fuentes de referencia: CocoLoop, MiniMax M2.7: Early Echoes of Self-Evolution (minimax.io); MiniMax M2.7 Advances Scalable Agentic Workflows on NVIDIA Platforms (NVIDIA Technical Blog); MiniMax M2.7 Matches GPT-5.3-Codex In Software Engineering Tasks (Dataconomy); MiniMax M2.7 Model Specs, Costs & Benchmarks (Galaxy.ai)