DeepSeek lança modelo de raciocínio R1 como código aberto

Em janeiro deste ano, a DeepSeek lançou diretamente o modelo de raciocínio R1 como código aberto, e a reação da comunidade foi imediata: Ninguém esperava que o lado do código aberto já tivesse chegado a esse nível.

Primeiro, vejamos os indicadores concretos:

  • Competição de matemática AIME: 77,5 pontos
  • MATH-500: 96,2 pontos
  • Programação Codeforces: Percentil 94
  • MMLU: 0,849

Olhando para esses números em conjunto, eles estão basicamente empatados com o OpenAI o1. Matemática, código, raciocínio lógico – um atleta completo em três modalidades.

Mas o que surpreende ainda mais é a versão destilada. O R1-Distill-Qwen-32B, um modelo destilado "pequeno" com 32B parâmetros, superou diretamente o o1-mini em vários benchmarks. 32B parâmetros são suficientes para igualar ou até superar modelos de raciocínio fechados – isso é uma dádiva dos céus para pequenas equipes e desenvolvedores independentes, pois roda em placas de vídeo de consumo.

O método de raciocínio do R1 segue a rota estruturada de Chain-of-Thought. Em cenários de contexto longo, ele demonstra claramente o fluxo "planejamento → execução → reflexão → correção". A janela de contexto de 128K oferece espaço suficiente para que a cadeia de raciocínio se desenvolva completamente, sem preocupações com interrupções no meio.

Falando de forma mais ampla do ponto de vista da indústria, o verdadeiro impacto do R1 está na lógica de precificação. Antes, o prêmio dos modelos fechados dependia em grande parte do "fosso da capacidade de raciocínio" – quem quisesse usar um bom modelo de raciocínio tinha que pagar. Agora, esse muro foi perfurado por um grande buraco pelo R1. Com o que os fabricantes de modelos fechados podem manter sua vantagem de preço? Apenas com marca e ecossistema?

Essa questão se tornará cada vez mais aguda nos próximos trimestres.

Fonte de referência: CocoLoop, reportagem de lançamento do DeepSeek R1 da InfoQ, página do modelo no Hugging Face