Ngày 20 tháng 8, danh sách mô hình trên OpenRouter xuất hiện thêm một dòng mới: stealth/ox-alpha. Cột nhà cung cấp chỉ ghi "Stealth", và trang mô tả vỏn vẹn một câu: mô hình này do một bên thứ ba chọn giữ ẩn danh phát triển và vận hành. Thông số kỹ thuật thì công khai đầy đủ: cửa sổ ngữ cảnh 1.048.576 token, tối đa 131.072 token đầu ra mỗi lượt, đầu vào chấp nhận văn bản, hình ảnh và video, hỗ trợ gọi hàm (function calling) và xuất JSON. Cột giá toàn số 0 — cả đầu vào lẫn đầu ra đều 0 USD trên mỗi triệu token.
Nhãn giá hai số 0
Nhìn cấu trúc lưu lượng có ích hơn nhìn thông số. Trên bảng xếp hạng ứng dụng của OpenRouter, những cái tên đổ nhiều lưu lượng nhất vào Ox Alpha là Hermes Agent, Claude Code và omp — toàn là vỏ agent, không một cửa sổ chat nào. Trang mô hình ghi độ trễ P50 là 6,70 giây, thông lượng 20 token/giây, tỷ lệ khả dụng ba ngày 99,50%, thời gian hoạt động 99,99%. Tốc độ này mà đặt vào sản phẩm hội thoại thì người dùng sẽ chửi thẳng mặt, nhưng đặt vào một tác vụ lập trình chạy suốt đêm thì chẳng ai bận tâm.
Miễn phí ở đây giống như đánh đổi chi phí suy luận lấy quỹ đạo dữ liệu hơn. Ngữ cảnh 1 triệu token cộng với đầu vào video, rồi lặp trong vòng lặp agent gọi công cụ liên tục, là hạng mục tốn kém nhất trong mọi loại yêu cầu. Nhà cung cấp tự bỏ tiền túi, đổi lại muốn thu về kiểu dữ liệu "mô hình gọi công cụ liên tục năm mươi lần trong một kho mã thật, thất bại, thử lại, rồi cuối cùng làm test chạy xanh" — một quy trình đầy đủ mà kho ngữ liệu công khai gần như không có, và cũng không thể tạo ra bằng cách chạy benchmark. Tỷ lệ lỗi gọi công cụ khoảng 4,45% ghi trên trang chỉ đo được chính xác khi có người thật, dự án thật đưa vào.
Nhẩm tính sơ bộ: một tác vụ vỏ agent thường tiêu tốn hàng trăm nghìn token, và một nhà phát triển "ăn chùa" cả tuần, chỉ riêng chi phí suy luận đã giúp nhà cung cấp tiết kiệm được một khoản tương đương phí gán nhãn dữ liệu — loại gán nhãn có sẵn bối cảnh nghiệp vụ thật và cả các trường hợp thất bại.
Dấu vân tay chỉ về Zhipu
Chỉ hai ngày sau khi ra mắt, cộng đồng đã thu hẹp phạm vi nghi vấn khá rõ. Một lỗi hệ thống để lộ stack trace phía server, trong đó xuất hiện đường dẫn com.wd.paas.api.domain.v4.chat.ChatCompletionRequest, khớp với cách đặt tên API trong tài liệu công khai của Zhipu; mã lỗi 1214 tái hiện được trên các mô hình dòng GLM trên OpenRouter, nhưng đổi sang mô hình cùng tên do DeepInfra lưu trữ thì không khớp; thử nghiệm tokenizer chạy 30 bộ mẫu, phủ nhiều hệ chữ viết, emoji, code và SQL, cả 30 bộ đều khớp cách tách token của GLM. Người thực hiện phép so sánh này tự chấm độ tin cậy 0,98 cho phán đoán của mình, trỏ về một biến thể của GLM-5.3. Giả thuyết phụ rơi vào đội MiMo của Xiaomi. Tất cả vẫn chỉ là suy luận từ bên ngoài, hiện chưa có bên nào đứng ra nhận.
Về điểm benchmark thì chỉ có vài mẫu rời rạc. Một nhà phát triển tên Ben Davis đo được 80% trên DeepSWE, cùng vòng đó Fable đạt 65%, GPT-5.6 Sol đạt 52%. Kết quả một người, một vòng test không thể coi là kết luận, nhưng lại khớp với cấu trúc lưu lượng: toàn bộ đều là agent lập trình.
Ra mắt ẩn danh đang trở thành một cách phát hành
Các mô hình ẩn danh trên OpenRouter đã xuất hiện vài lần trước đó. Hai mô hình mang tên mã Hunter và Healer từng đi đúng con đường này: miễn phí một thời gian, sau đó được đội MiMo của Xiaomi nhận là của mình, rồi mới treo giá chính thức. GLM-5 và MiMo-V2-Pro cũng từng ra mắt theo cách tương tự.
Quy trình này đã ổn định đến mức có thể xem như một kiểu phát hành riêng — giai đoạn ẩn danh dùng để thu dữ liệu, gây dựng tiếng tăm, tránh bị so sánh dồn dập ngay ngày công bố; đợi khi thứ hạng và tiếng lành trong giới lập trình đã vững, mới bỏ mặt nạ và chuyển sang thu phí.
Với các nhà sản xuất Trung Quốc, cách này còn có thêm một lợi ích khác. Khi một mô hình xuất hiện với nhãn "phòng thí nghiệm Trung Quốc XYZ", phản ứng đầu tiên của nhiều nhà phát triển nước ngoài thường là để ý đến xuất xứ trước; còn khi không nêu tên, đánh giá chỉ có thể dựa vào chính đoạn mã. Đến khi danh tính được công bố, loạt đánh giá tích cực trước đó đã nằm sẵn trong các bài đăng diễn đàn và dòng tweet.
Cái giá của sự miễn phí được ghi ngay trên trang. Mục chính sách dữ liệu của OpenRouter nêu rõ prompt và kết quả trả về do bên cung cấp lưu giữ, chỉ cam kết không dùng để huấn luyện; trong khi đường kết nối trực tiếp của OpenCode lại ghi rõ "không lưu trữ dữ liệu". Hai cách diễn đạt này không khớp nhau trên cùng một chuỗi yêu cầu. Dùng nó để chạy các dự án mã nguồn mở thì ảnh hưởng không đáng kể, nhưng trước khi nhét nguyên một kho mã riêng của công ty vào cửa sổ 1 triệu token này, dòng chữ nhỏ đó nên được đọc kỹ trước.
OpenRouter chỉ nói giai đoạn xem trước là một thử nghiệm có giới hạn thời gian, nhưng không nêu ngày kết thúc. Khi nào bỏ mặt nạ, và sau đó bán với giá bao nhiêu, hiện chưa ai có câu trả lời chắc chắn.
Nguồn tham khảo: Trang mô hình OpenRouter và mô tả chính sách dữ liệu của bên cung cấp, CocoLoop, các bản ghi so sánh dấu vân tay và bài đăng benchmark công khai từ cộng đồng lập trình viên; cửa sổ ngữ cảnh, đầu ra tối đa, độ trễ và thông lượng theo số liệu trên trang mô hình OpenRouter, kết quả DeepSWE là bài test một vòng của một nhà phát triển.