Together branche Claude Code sur des modèles ouverts, coûts à moitié

Together AI a lancé le 5 octobre Together Link, qui permet aux développeurs, sans changer d'outil, de remplacer le modèle derrière des agents de codage comme Claude Code et Codex par des modèles open source hébergés chez Together. L'entreprise affirme que le coût des modèles peut baisser de plus de moitié, en comparaison avec les mêmes sessions entièrement exécutées sur Claude Opus 5.5.

Cinq clients sont actuellement pris en charge : Claude Code, Claude Desktop, Codex (l'application ChatGPT et la version en ligne de commande), OpenCode et Pi.

Comment s'y connecter, comment revenir en arrière

L'installation se fait en une seule commande shell ; une fois cela fait, les réglages et les sessions déjà connectées de chaque outil restent inchangés. Together insiste sur ce point dans son annonce :

"Settings and logins stay as they were, there's nothing new to learn, and going back to the native closed models takes one command."

(Les réglages et les connexions restent comme avant, il n'y a rien de nouveau à apprendre, et revenir aux modèles fermés natifs ne demande, lui aussi, qu'une seule commande.)

La facturation passe par la clé API Together que le développeur possède déjà, au volume d'usage ou via un forfait prépayé, sans contrat séparé à signer. À la fin de chaque session, l'outil affiche la dépense réelle, ainsi qu'une estimation de ce qu'aurait coûté la même session sur Opus 5.5.

Le routage n'a lieu qu'une seule fois par session

Le cœur du produit est un mode appelé Auto, dans lequel le Together AI Router décide quel modèle utiliser pour chaque session. Il lit la première tâche de la session : les petites corrections vont à un modèle bon marché et rapide, les problèmes difficiles à un modèle de pointe.

Le routage n'a lieu qu'une seule fois par session. Selon Together, cela permet de conserver l'efficacité du cache de prompts. Une session d'agent de codage compte souvent des dizaines d'échanges avec un contexte très répétitif ; le taux de succès du cache déterminant directement le coût, changer de modèle en cours de session reviendrait à vider le cache.

Les modèles proposés se répartissent en deux groupes :

  • Pointe : GLM 5.3, de Zhipu AI, et Kimi K3, de Moonshot AI, pour les tâches de codage les plus difficiles ;
  • Quotidien : GLM 5.3 Flash et DeepSeek V4.1 Flash, pour les modifications courantes.

Si l'utilisateur renseigne aussi une clé Anthropic, le routeur répartit entre Opus 5.5 et GLM 5.3 ; sans clé Anthropic, le choix se fait entre GLM 5.3 et GLM 5.3 Flash.

L'annonce ne donne pas les scores de chaque modèle sur les benchmarks de codage, et ne précise pas sur quelle combinaison de tâches le chiffre de "plus de moitié" a été mesuré. La comparaison de coûts affichée par session reste une statistique après coup ; la baisse réelle dépend de la composition des tâches propre à chaque équipe.

Les quatre modèles viennent tous d'équipes chinoises

Pour le lecteur chinois, cette liste a une signification supplémentaire : les quatre modèles open source que Together Link met en avant viennent tous d'équipes chinoises, respectivement Zhipu AI, Moonshot AI et DeepSeek. Un fournisseur américain de cloud d'inférence utilise des modèles open source chinois pour remplacer le modèle Anthropic derrière un agent de codage américain, et l'argument de vente est le prix.

Dans son annonce, Together cite des données d'OpenRouter au 30 septembre : sur OpenRouter, 40,8% des tokens de DeepSeek V4.1 Flash ont été servis par Together, 28,2% pour GLM 5.3 Flash et 23,1% pour Kimi K3. Ces chiffres montrent que l'usage réel des modèles open source chinois par les développeurs étrangers n'est déjà plus négligeable.

Pour les développeurs chinois, l'utilité directe est limitée. Claude Code se heurte déjà à des barrières d'accès en Chine, et Zhipu AI, Moonshot AI et DeepSeek proposent chacun leurs propres interfaces compatibles avec Claude Code ainsi que des forfaits de codage, se connecter directement à l'API officielle étant souvent moins coûteux. Together Link vise surtout les équipes d'ingénierie à l'étranger qui étouffent sous leur facture Opus sans vouloir changer leur flux de travail. L'annonce indique que les dépenses mensuelles en agents de codage de ces équipes vont de quelques dizaines de milliers à plus d'un million de dollars.

Anthropic et OpenAI ne se sont pour l'instant pas exprimés publiquement sur le fait que des tiers connectent leurs clients à des modèles d'autres entreprises.

Sources : blog officiel de Together AI, CocoLoop, données de la plateforme OpenRouter ; les parts de tokens suivent les statistiques d'OpenRouter citées par Together, et "plus de moitié" est le chiffre avancé par l'entreprise elle-même.