En agosto del año pasado, DeepSeek lanzó V3.1, su primer modelo híbrido — que combina las capacidades de V3 (general) y R1 (razonamiento) en un mismo modelo.
Diseño de arquitectura
- Parámetros totales: 671B, activa 37B por token
- 256 expertos por capa, activa 8
- Dos modos intercambiables con un clic:
- Think mode (deepseek-reasoner): razonamiento en múltiples pasos + llamada a herramientas
- Non-think mode (deepseek-chat): conversación cotidiana, respuestas ligeras y rápidas
Ambos modos comparten pesos, contexto de 128K.
¿Por qué "híbrido" es mejor?
Veamos directamente las puntuaciones en SWE-bench Verified:
- V3.1: 66,0%
- R1-0528: 44,6%
En el benchmark de programación, el modelo híbrido supera al modelo de razonamiento puro. El Think mode alcanza aproximadamente el 90-95% del nivel de R1 en tareas intensivas de razonamiento, con una velocidad de respuesta más rápida.
En esencia, V3.1 demuestra una cosa: un solo modelo puede manejar tanto "preguntas y respuestas rápidas" como "razonamiento profundo" — dos escenarios que antes requerían implementación por separado.
Detalles de entrenamiento
Basado en V3.1-Base, se entrenaron 840 mil millones de tokens adicionales:
- Fase de 32K: 630 mil millones de tokens
- Fase de expansión a 128K: 209 mil millones de tokens
El enfoque estuvo en mejorar la comprensión de contexto largo, el uso de herramientas y los flujos de trabajo de agente. DeepSeek posiciona oficialmente a V3.1 como "el primer paso hacia la era de los Agentes".
Desde un punto de vista práctico, con V3.1 ya no es necesario decidir entre "usar un modelo general o un modelo de razonamiento" — simplemente se le envía la tarea y se deja que el modelo decida.
Fuente de referencia: CocoLoop, reportaje de The Decoder, comunicado oficial de DeepSeek