Decision-1, da Microsoft, é construído sobre o Qwen 9B

Em 9 de outubro, a Microsoft lançou, na sua publicação técnica Command Line, o Microsoft-Decision-1, um modelo feito só para "questões de múltipla escolha": roteamento, classificação, ranqueamento, validação e controle de fluxos de trabalho. O artigo é assinado por Achint Srivastava, vice-presidente de engenharia de software do escritório do diretor de tecnologia da Microsoft. O modelo já está disponível no Microsoft Foundry e também foi integrado ao OpenRouter.

A saída dele é bem estreita. Quem chama o modelo primeiro entrega um conjunto fixo de opções, o modelo devolve para cada uma delas uma probabilidade calibrada, e o software executa o resultado diretamente. Há suporte para perguntas de sim ou não, múltipla escolha, atribuição de notas e notas segundo uma rubrica; escrever textos longos ou fazer raciocínios complexos não faz parte do que ele se propõe a fazer.

Os resultados divulgados pela própria Microsoft

A Microsoft afirma que o Decision-1 teve a maior precisão numa comparação com 36 benchmarks e cerca de 150 mil questões, com latência P50 de aproximadamente 1/35 da do GPT-6 Sol. O artigo dá um exemplo: num fluxo que encadeia 20 decisões, se cada uma demorar 100 milissegundos a mais, a cadeia inteira fica 2 segundos mais lenta.

Quanto à estabilidade, quando a mesma requisição sofreu 8 tipos de perturbação, a taxa média de inversão da decisão foi de 1,3%; ao apenas reescrever, inverter ou embaralhar a ordem das opções, a taxa de inversão foi zero. O princípio que a Microsoft estabeleceu para esse teste é:

"Equivalent inputs should produce equivalent decisions." (Entradas equivalentes devem produzir decisões equivalentes.)

Os testes de segurança abrangeram 11 benchmarks e 5.250 requisições, incluindo conteúdo nocivo, jailbreak e injeção de prompt, mas o texto não informa taxas de recusa.

Há alguns números do uso interno. A equipe de pesquisa do Xbox usou o modelo para processar mais de dez mil comentários de usuários, com qualidade equivalente à do GPT-6 Sol, velocidade mais de 14 vezes maior e custo mais de 200 vezes menor; a equipe do Copilot mediu qualidade equivalente à do GPT-5.6 Luna e velocidade 100 vezes maior. Tudo isso vem de medições da própria Microsoft. O artigo não lista os nomes dos 36 benchmarks nem a precisão exata em cada um, e até agora não há reprodução por terceiros. Quanto a qual modelo ficou em segundo lugar e quão mais lento ele é, o texto original da Microsoft e o resumo em chinês dão versões que não batem; vale seguir as atualizações oficiais posteriores.

O preço acompanha o uso

O preço é de US$ 0,042 por milhão de tokens de entrada, com saída gratuita, o que, pela conversão do ITHome, equivale a cerca de 0,28 yuan. A saída das chamadas de decisão costuma ter apenas alguns tokens, e o dinheiro vai principalmente para o contexto de entrada; esse modelo de preços combina com o uso real.

Esse tipo de modelo costuma ficar à frente do modelo grande nas aplicações: primeiro decide para qual modelo uma requisição deve ir e por qual fluxo seguir, ou avalia se o resultado de uma etapa do agente é aceitável, e só então define o passo seguinte. Esses julgamentos eram feitos, na maioria das vezes, de passagem por um modelo grande de uso geral; trocá-lo por um modelo especializado, pequeno e rápido economiza latência e custo de chamada.

A base vem do Qwen

Há uma frase de peso no artigo: o Decision-1 foi pós-treinado (post-training) sobre o Qwen3.5-9B, aberto pela Alibaba. A Microsoft diz ainda que, mais adiante, vai transferir o mesmo método para outras bases, citando os modelos próprios da Microsoft AI (MAI) e os da OpenAI.

Para os desenvolvedores na China, a informação pode ser lida por três ângulos. Primeiro, os pesos abertos do Qwen entraram num produto oficial da Microsoft, que indica a origem de forma explícita no anúncio. Segundo, para quem quiser construir algo parecido, o caminho está basicamente exposto: pegar um modelo aberto da classe de 9B, pós-treiná-lo em torno de "opções fixas mais probabilidades calibradas" e obter o resultado em uma única passada direta. Terceiro, o próprio Decision-1 não tem pesos abertos, de modo que na China só dá para usá-lo pelas interfaces do Foundry ou do OpenRouter; já a base, o Qwen3.5-9B, pode ser baixada diretamente.

Neste ano, a Microsoft já lançou vários modelos próprios da linha MAI. O Decision-1 começa apoiado numa base aberta externa; se o desempenho se manterá depois da mudança para uma base MAI, só os dados da próxima versão dirão.

Fontes: artigo da Microsoft no Command Line, CocoLoop, ITHome; o número de benchmarks, o múltiplo de latência e o preço por milhão de tokens foram conferidos segundo o critério de medição da própria Microsoft.