Together gắn mô hình mở vào Claude Code, tuyên bố giảm nửa chi phí

Together AI ra mắt Together Link vào ngày 5 tháng 10, cho phép các nhà phát triển, không cần đổi công cụ, thay mô hình đứng sau các tác tử lập trình như Claude Code, Codex bằng các mô hình mã nguồn mở được lưu trữ trên Together. Công ty cho biết chi phí mô hình có thể giảm hơn một nửa, so với mức chuẩn là chạy toàn bộ phiên làm việc trên Claude Opus 5.5.

Hiện có năm ứng dụng khách được hỗ trợ: Claude Code, Claude Desktop, Codex (bản ứng dụng ChatGPT và bản dòng lệnh), OpenCode và Pi.

Kết nối thế nào, quay lại thế nào

Việc cài đặt chỉ là một lệnh shell, sau khi cài xong các thiết lập và trạng thái đăng nhập sẵn có của từng công cụ không bị thay đổi. Together nhấn mạnh điều này trong thông báo:

"Settings and logins stay as they were, there's nothing new to learn, and going back to the native closed models takes one command."

(Thiết lập và đăng nhập giữ nguyên như trước, không có gì mới phải học, và muốn quay lại các mô hình đóng gốc cũng chỉ cần một lệnh.)

Việc tính phí dùng key API Together mà nhà phát triển đã có sẵn, trả theo lượng dùng hoặc mua gói đều được, không cần ký hợp đồng riêng. Sau mỗi phiên làm việc, công cụ sẽ hiển thị số tiền thực tế đã chi, cùng với ước tính nếu phiên đó chạy trên Opus 5.5 thì sẽ tốn khoảng bao nhiêu.

Định tuyến chỉ diễn ra một lần cho mỗi phiên

Trọng tâm của sản phẩm là một chế độ gọi là Auto, do Together AI Router quyết định mỗi phiên dùng mô hình nào. Nó đọc nhiệm vụ đầu tiên trong phiên: sửa lỗi nhỏ thì giao cho mô hình rẻ và nhanh, bài toán khó thì giao cho mô hình ở mức tiên phong.

Việc định tuyến chỉ xảy ra một lần cho mỗi phiên. Theo giải thích của Together, cách này giữ cho bộ nhớ đệm prompt tiếp tục có hiệu lực. Một phiên của tác tử lập trình thường kéo dài vài chục lượt, phần ngữ cảnh lặp lại rất nhiều, tỷ lệ trúng cache quyết định trực tiếp chi phí — đổi mô hình giữa phiên đồng nghĩa với xóa sạch cache.

Các mô hình có thể chọn chia thành hai nhóm:

  • Mức tiên phong: GLM 5.3 của Zhipu AI, Kimi K3 của Moonshot AI, dùng cho các nhiệm vụ lập trình khó nhất;
  • Mức hàng ngày: GLM 5.3 Flash, DeepSeek V4.1 Flash, xử lý các thay đổi thường ngày.

Nếu người dùng đồng thời điền key của Anthropic, bộ định tuyến sẽ phân bổ giữa Opus 5.5 và GLM 5.3; nếu không có key Anthropic, sẽ chọn giữa GLM 5.3 và GLM 5.3 Flash.

Thông báo không công bố điểm số của từng mô hình trên các benchmark lập trình, cũng không nói rõ con số "giảm hơn một nửa" được đo trên tổ hợp nhiệm vụ nào. Mức so sánh chi phí hiển thị theo từng phiên chỉ là thống kê sau thực tế, mức giảm thật còn tùy vào cấu trúc công việc của mỗi nhóm.

Cả bốn mô hình đều của các nhóm Trung Quốc

Với độc giả trong nước, danh sách này còn có một lớp ý nghĩa khác: bốn mô hình mã nguồn mở mà Together Link chủ yếu quảng bá đều xuất phát từ các nhóm Trung Quốc, lần lượt đến từ Zhipu AI, Moonshot AI và DeepSeek. Một công ty điện toán suy luận của Mỹ dùng các mô hình mã nguồn mở của Trung Quốc để thay thế mô hình Anthropic đứng sau một tác tử lập trình của Mỹ, với điểm bán hàng là giá rẻ.

Trong thông báo, Together dẫn dữ liệu của OpenRouter tính đến ngày 30 tháng 9: trên OpenRouter, 40,8% token của DeepSeek V4.1 Flash được Together phục vụ, GLM 5.3 Flash là 28,2%, Kimi K3 là 23,1%. Những con số này cho thấy mức sử dụng thực tế của các nhà phát triển nước ngoài đối với mô hình mã nguồn mở Trung Quốc đã không nhỏ.

Đối với nhà phát triển trong nước, giá trị trực tiếp khá hạn chế. Claude Code ở Trung Quốc vốn đã có rào cản truy cập, còn Zhipu AI, Moonshot AI, DeepSeek đều đã tự cung cấp giao diện tương thích Claude Code cùng các gói lập trình riêng, nối thẳng vào API chính hãng thường rẻ hơn. Together Link chủ yếu hướng tới các nhóm kỹ thuật ở nước ngoài đang ngạt thở vì hóa đơn Opus mà lại không muốn thay đổi quy trình làm việc. Thông báo cho biết chi phí tác tử lập trình của các nhóm này dao động từ vài chục nghìn đến hơn một triệu USD mỗi tháng.

Anthropic và OpenAI hiện chưa lên tiếng công khai về việc bên thứ ba kết nối ứng dụng khách của họ với mô hình của hãng khác.

Nguồn tham khảo: blog chính thức của Together AI, CocoLoop, dữ liệu nền tảng OpenRouter; tỷ lệ token theo thống kê OpenRouter mà Together trích dẫn, mức "giảm hơn một nửa" là theo công bố của công ty.