En enero de este año, DeepSeek lanzó directamente el modelo de razonamiento R1 como código abierto, y la reacción de la comunidad fue inmediata: Nadie esperaba que el lado del código abierto ya hubiera llegado a este nivel.
Primero, veamos los indicadores concretos:
- Concurso de matemáticas AIME: 77,5 puntos
- MATH-500: 96,2 puntos
- Programación Codeforces: Percentil 94
- MMLU: 0,849
Mirando estos números en conjunto, están básicamente empatados con OpenAI o1. Matemáticas, código, razonamiento lógico – un atleta completo en tres disciplinas.
Pero lo que sorprende aún más es la versión destilada. R1-Distill-Qwen-32B, un modelo destilado "pequeño" con 32B parámetros, superó directamente a o1-mini en varios benchmarks. 32B parámetros son suficientes para igualar o incluso superar los modelos de razonamiento cerrados – esto es un regalo del cielo para equipos pequeños y desarrolladores independientes, ya que se ejecuta en tarjetas gráficas de consumo.
El método de razonamiento de R1 sigue la ruta estructurada de Chain-of-Thought. En escenarios de contexto largo, demuestra claramente el flujo "planificación → ejecución → reflexión → corrección". La ventana de contexto de 128K ofrece suficiente espacio para que la cadena de razonamiento se desarrolle completamente, sin preocupaciones por interrupciones en medio.
Hablando de manera más amplia desde la perspectiva de la industria, el verdadero impacto de R1 está en la lógica de precios. Antes, la prima de los modelos cerrados dependía en gran medida del "foso de la capacidad de razonamiento" – quien quisiera usar un buen modelo de razonamiento tenía que pagar. Ahora, este muro ha sido perforado por un gran agujero por R1. ¿Con qué pueden los fabricantes de modelos cerrados mantener su ventaja de precios? ¿Solo con marca y ecosistema?
Esta pregunta se volverá cada vez más aguda en los próximos trimestres.
Fuente de referencia: CocoLoop, informe de lanzamiento de DeepSeek R1 de InfoQ, página del modelo en Hugging Face