Together AI hat am 5. Oktober Together Link vorgestellt: Entwickler können, ohne ihr Tool zu wechseln, das Modell hinter Coding-Agenten wie Claude Code oder Codex gegen bei Together gehostete Open-Source-Modelle tauschen. Das Unternehmen gibt an, die Modellkosten ließen sich um mehr als die Hälfte senken, verglichen mit dem Betrieb derselben Sitzungen vollständig auf Claude Opus 5.5.
Unterstützt werden derzeit fünf Clients: Claude Code, Claude Desktop, Codex (die ChatGPT-App und die Kommandozeilenversion), OpenCode und Pi.
Wie man es anschließt – und wie man zurückschaltet
Die Installation ist ein einziger Shell-Befehl; danach bleiben die bestehenden Einstellungen und Logins der einzelnen Tools unverändert. Together betont das in der Ankündigung ausdrücklich:
"Settings and logins stay as they were, there's nothing new to learn, and going back to the native closed models takes one command."
(Einstellungen und Logins bleiben wie gewohnt, es gibt nichts Neues zu lernen, und die Rückkehr zu den nativen geschlossenen Modellen braucht nur einen Befehl.)
Abgerechnet wird über den Together-API-Key, den Entwickler bereits besitzen, nach Verbrauch oder per Guthabenpaket – ein eigener Vertrag ist nicht nötig. Nach jeder Sitzung zeigt das Tool an, wie viel tatsächlich ausgegeben wurde und was dieselbe Sitzung auf Opus 5.5 ungefähr gekostet hätte.
Routing passiert nur einmal pro Sitzung
Kern des Produkts ist ein Modus namens Auto, bei dem der Together AI Router entscheidet, welches Modell eine Sitzung nutzt. Er liest die erste Aufgabe der Sitzung: kleine Korrekturen gehen an ein billiges, schnelles Modell, schwierige Probleme an ein Modell der Spitzenklasse.
Das Routing erfolgt nur einmal pro Sitzung. Together begründet das damit, dass so das Prompt-Caching durchgehend wirksam bleibt. Eine Sitzung eines Coding-Agenten umfasst oft Dutzende Runden mit stark wiederholtem Kontext; die Cache-Trefferquote entscheidet direkt über die Kosten – ein Modellwechsel mitten in der Sitzung würde den Cache komplett leeren.
Die wählbaren Modelle sind in zwei Gruppen aufgeteilt:
- Spitzenklasse: GLM 5.3 von Zhipu AI und Kimi K3 von Moonshot AI, für die schwierigsten Coding-Aufgaben;
- Alltagsklasse: GLM 5.3 Flash und DeepSeek V4.1 Flash, für alltägliche Änderungen.
Hinterlegt der Nutzer zusätzlich einen Anthropic-Key, verteilt der Router zwischen Opus 5.5 und GLM 5.3; ohne Anthropic-Key wird zwischen GLM 5.3 und GLM 5.3 Flash gewählt.
In der Ankündigung fehlen Benchmark-Werte für die einzelnen Modelle, und es bleibt offen, an welcher Aufgabenmischung die Zahl "mehr als die Hälfte" gemessen wurde. Der pro Sitzung angezeigte Kostenvergleich ist eine nachträgliche Statistik; wie groß die tatsächliche Einsparung ausfällt, hängt von der Aufgabenstruktur jedes Teams ab.
Alle vier Modelle stammen von chinesischen Teams
Für chinesische Leser hat diese Liste eine zusätzliche Bedeutung: Die vier Open-Source-Modelle, die Together Link in den Vordergrund stellt, stammen ausnahmslos von chinesischen Teams – Zhipu AI, Moonshot AI und DeepSeek. Ein US-amerikanischer Inference-Cloud-Anbieter ersetzt mit chinesischen Open-Source-Modellen das Anthropic-Modell hinter einem US-amerikanischen Coding-Agenten, und das Verkaufsargument ist der Preis.
Together verweist in der Ankündigung auf OpenRouter-Daten mit Stand 30. September: Auf OpenRouter wurden 40,8 % der Token von DeepSeek V4.1 Flash über Together ausgeliefert, bei GLM 5.3 Flash waren es 28,2 %, bei Kimi K3 23,1 %. Diese Zahlen zeigen, dass ausländische Entwickler chinesische Open-Source-Modelle bereits in erheblichem Umfang nutzen.
Für Entwickler in China selbst ist der unmittelbare Nutzen begrenzt. Claude Code ist dort ohnehin mit Zugangshürden verbunden, und Zhipu AI, Moonshot AI sowie DeepSeek bieten jeweils eigene, zu Claude Code kompatible Schnittstellen samt Coding-Paketen an – der direkte Weg über die offizielle API ist meist günstiger. Together Link richtet sich vor allem an Engineering-Teams im Ausland, die unter ihrer Opus-Rechnung ächzen, ihren Workflow aber nicht ändern wollen. Laut Ankündigung reichen die monatlichen Coding-Agent-Ausgaben solcher Teams von einigen Zehntausend bis über einer Million US-Dollar.
Anthropic und OpenAI haben sich bislang nicht öffentlich dazu geäußert, dass Dritte ihre Clients an fremde Modelle anbinden.
Quellen: offizieller Blog von Together AI, CocoLoop, Plattformdaten von OpenRouter; die Token-Anteile folgen der von Together zitierten OpenRouter-Statistik, die Angabe "mehr als die Hälfte" stammt vom Unternehmen selbst.