A Together AI lançou em 5 de outubro o Together Link, que permite aos desenvolvedores, sem trocar de ferramenta, substituir o modelo por trás de agentes de codificação como Claude Code e Codex por modelos de código aberto hospedados na Together. A empresa afirma que o custo com modelos pode cair mais da metade, tendo como referência as mesmas sessões rodando inteiramente no Claude Opus 5.5.
Atualmente cinco clientes são suportados: Claude Code, Claude Desktop, Codex (o app do ChatGPT e a versão de linha de comando), OpenCode e Pi.
Como conectar e como voltar atrás
A instalação é um único comando de shell; depois disso, as configurações e sessões já existentes de cada ferramenta permanecem intactas. A Together destaca isso no anúncio:
"Settings and logins stay as they were, there's nothing new to learn, and going back to the native closed models takes one command."
(As configurações e logins permanecem como estavam, não há nada novo para aprender, e voltar aos modelos fechados nativos também é só um comando.)
A cobrança usa a chave de API da Together que o desenvolvedor já possui, por uso ou por pacote de créditos pré-pagos, sem necessidade de contrato separado. Ao final de cada sessão, a ferramenta mostra quanto foi gasto de fato e quanto a mesma sessão custaria aproximadamente se rodasse no Opus 5.5.
O roteamento acontece só uma vez por sessão
O núcleo do produto é um modo chamado Auto, em que o Together AI Router decide qual modelo cada sessão vai usar. Ele lê a primeira tarefa da sessão: pequenos ajustes vão para um modelo barato e rápido, problemas difíceis vão para um modelo de ponta.
O roteamento ocorre apenas uma vez por sessão. Segundo a Together, isso mantém o cache de prompt funcionando o tempo todo. Uma sessão de agente de codificação costuma ter dezenas de turnos com muito contexto repetido; a taxa de acerto do cache determina diretamente o custo — trocar de modelo no meio da sessão zeraria o cache.
Os modelos disponíveis se dividem em dois grupos:
- Ponta: GLM 5.3, da Zhipu AI, e Kimi K3, da Moonshot AI, para as tarefas de codificação mais difíceis;
- Cotidiano: GLM 5.3 Flash e DeepSeek V4.1 Flash, para alterações do dia a dia.
Se o usuário também informar uma chave da Anthropic, o roteador distribui entre Opus 5.5 e GLM 5.3; sem chave da Anthropic, a escolha é entre GLM 5.3 e GLM 5.3 Flash.
O anúncio não traz pontuações de cada modelo em benchmarks de codificação, nem detalha sobre qual combinação de tarefas foi medida a cifra de "mais da metade". A comparação de custo exibida por sessão é uma estatística posterior; a redução real depende da composição de tarefas de cada equipe.
Os quatro modelos são todos de equipes chinesas
Para o leitor chinês, essa lista carrega um significado adicional: os quatro modelos de código aberto que o Together Link privilegia vêm todos de equipes chinesas — Zhipu AI, Moonshot AI e DeepSeek. Uma empresa americana de nuvem de inferência usa modelos abertos chineses para substituir o modelo da Anthropic por trás de um agente de codificação americano, vendendo isso como mais barato.
No anúncio, a Together cita dados do OpenRouter até 30 de setembro: no OpenRouter, 40,8% dos tokens do DeepSeek V4.1 Flash foram servidos pela Together, 28,2% no caso do GLM 5.3 Flash e 23,1% no do Kimi K3. Esses números mostram que o uso real de modelos abertos chineses por desenvolvedores estrangeiros já não é pequeno.
Para desenvolvedores chineses, a utilidade direta é limitada. O Claude Code já enfrenta barreiras de acesso na China, e Zhipu AI, Moonshot AI e DeepSeek oferecem, cada uma, interfaces compatíveis com o Claude Code e pacotes de codificação próprios, geralmente mais baratos ao usar a API oficial direto. O Together Link visa principalmente equipes de engenharia no exterior sufocadas pela conta do Opus, mas sem vontade de mudar o fluxo de trabalho. O anúncio menciona que os gastos mensais dessas equipes com agentes de codificação vão de dezenas de milhares a mais de um milhão de dólares.
Anthropic e OpenAI, por ora, não se manifestaram publicamente sobre terceiros conectarem seus clientes a modelos de outras empresas.
Fontes: blog oficial da Together AI, CocoLoop, dados da plataforma OpenRouter; as participações de tokens seguem a estatística do OpenRouter citada pela Together, e "mais da metade" é o número divulgado pela própria empresa.