A empresa independente de avaliação Artificial Analysis divulgou novos resultados para o Claude Fable 5.1: índice geral de inteligência de 66 pontos, o primeiro lugar entre 192 modelos testados. A geração anterior, o Fable 5, obteve 62 pontos e ficou em sexto lugar.
No mesmo conjunto de resultados aparece outra série de números. Para rodar toda a bateria de avaliação do índice de inteligência, o Fable 5.1 gastou 8523.16 dólares, enquanto o Fable 5 gastou 5455.22 dólares; convertendo para o custo de uma única tarefa, o valor subiu de 3.14 para 3.69 dólares.
O preço por token não mudou, mas o modelo passou a falar mais
Os preços de tabela das duas gerações são idênticos: 10 dólares por milhão de tokens de entrada, 50 dólares por milhão de tokens de saída. Os mais de três mil dólares extras vêm inteiramente do comprimento das respostas — o Fable 5 gerou 83 milhões de tokens de saída ao completar a bateria de testes, o 5.1 gerou 140 milhões, um aumento de cerca de 69%. A Artificial Analysis aponta uma mediana de 71 milhões de tokens, ou seja, o volume de saída do 5.1 é quase o dobro da mediana.
Isso está alinhado com a tendência geral dos modelos de raciocínio no último ano: o ganho de capacidade vem de o modelo pensar em mais etapas, mas a cobrança é por token, então a conta cresce junto com o tempo de raciocínio. Para quem paga uma assinatura mensal, não há impacto direto; para equipes que pagam por API, para o mesmo volume de tarefas, o orçamento precisa ser recalculado.
Quase cinco minutos até o primeiro token
A coluna de velocidade chama ainda mais atenção. O Fable 5.1 produz 66.4 tokens por segundo, na posição 84 entre 192 modelos, abaixo da mediana de 70; o tempo até o primeiro token foi de 296.81 segundos, contra 116.06 segundos da geração anterior — mais de uma vez e meia mais lento.
Esse número de latência é praticamente inviável em cenários interativos, mas ele mede o processo completo de raciocínio — o modelo pensa bastante antes de produzir o primeiro caractere. Numa tarefa de fundo sem ninguém esperando, cinco minutos não são um problema; esperando por uma sugestão de código no editor, é outra história.
Comparando com o GPT-5.6 Sol
No mesmo ranking, o GPT-5.6 Sol, da OpenAI, obteve 61 pontos e ficou em oitavo lugar, gastando 2017.29 dólares para completar toda a bateria de testes, com custo de 0.95 dólar por tarefa, gerando 70 milhões de tokens de saída, com preço de tabela de 4 dólares (entrada) e 20 dólares (saída) por milhão de tokens.
Fazendo as contas: o Fable 5.1 tem 5 pontos a mais no índice de inteligência, mas o custo por tarefa é 3.9 vezes maior e o custo total da bateria de testes é 4.2 vezes maior. É difícil afirmar qual dos dois compensa mais — os dois atendem tipos de tarefa diferentes, e o tempo economizado ao acertar uma tarefa complexa de primeira pode muito bem compensar essa diferença de preço. Mas isso explica por que cada vez mais equipes adotam um roteamento em camadas entre modelos: as tarefas difíceis vão para o líder do ranking, e os outros oitenta por cento de tarefas rotineiras ficam com a opção mais barata.
O ranking só responde a uma pergunta: quem é o mais inteligente. Quem paga a conta precisa responder à segunda pergunta sozinho: quanto vale esse ponto a mais.
Fontes: página de comparação de modelos da Artificial Analysis, CocoLoop; a pontuação do índice de inteligência, o custo total da avaliação, o custo por tarefa, o volume de tokens de saída e a latência do primeiro token vêm da mesma rodada de testes públicos dessa organização.