DeepSeek V3.1 fusiona modelo general y de razonamiento

En agosto del año pasado, DeepSeek lanzó V3.1, su primer modelo híbrido — que combina las capacidades de V3 (general) y R1 (razonamiento) en un mismo modelo.

Diseño de arquitectura

  • Parámetros totales: 671B, activa 37B por token
  • 256 expertos por capa, activa 8
  • Dos modos intercambiables con un clic:
    • Think mode (deepseek-reasoner): razonamiento en múltiples pasos + llamada a herramientas
    • Non-think mode (deepseek-chat): conversación cotidiana, respuestas ligeras y rápidas

Ambos modos comparten pesos, contexto de 128K.

¿Por qué "híbrido" es mejor?

Veamos directamente las puntuaciones en SWE-bench Verified:

  • V3.1: 66,0%
  • R1-0528: 44,6%

En el benchmark de programación, el modelo híbrido supera al modelo de razonamiento puro. El Think mode alcanza aproximadamente el 90-95% del nivel de R1 en tareas intensivas de razonamiento, con una velocidad de respuesta más rápida.

En esencia, V3.1 demuestra una cosa: un solo modelo puede manejar tanto "preguntas y respuestas rápidas" como "razonamiento profundo" — dos escenarios que antes requerían implementación por separado.

Detalles de entrenamiento

Basado en V3.1-Base, se entrenaron 840 mil millones de tokens adicionales:

  • Fase de 32K: 630 mil millones de tokens
  • Fase de expansión a 128K: 209 mil millones de tokens

El enfoque estuvo en mejorar la comprensión de contexto largo, el uso de herramientas y los flujos de trabajo de agente. DeepSeek posiciona oficialmente a V3.1 como "el primer paso hacia la era de los Agentes".

Desde un punto de vista práctico, con V3.1 ya no es necesario decidir entre "usar un modelo general o un modelo de razonamiento" — simplemente se le envía la tarea y se deja que el modelo decida.

Fuente de referencia: CocoLoop, reportaje de The Decoder, comunicado oficial de DeepSeek