Zhipu ra mắt GLM-5.3-FlashX: tốc độ tăng 5 lần, giá tăng 2,5 lần

Ngày 18 tháng 9, Zhipu ra mắt GLM-5.3-FlashX, API mở đồng thời, định danh mô hình là GLM-5.3-FlashX. Chỉ số chính thức duy nhất được công bố là tốc độ đầu ra tối đa 200 token/giây, theo Zhipu là gấp 5 lần GLM-5.3-Flash hiện có.

Năng lực mô hình ở phân khúc này không thay đổi. Tài liệu mở cho thấy Flash và FlashX dùng chung một bộ thông số: cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 128.000 token, đầu vào hỗ trợ video, hình ảnh, văn bản và tệp, đầu ra là văn bản, hỗ trợ chế độ suy luận, gọi công cụ, trả về dạng luồng, bộ nhớ đệm ngữ cảnh và đầu ra JSON có cấu trúc. Khác biệt được nêu rõ: FlashX đổi lấy thông lượng, Flash giữ mức giá thấp.

Giá tăng theo tốc độ

Theo các nguồn tin công khai, mức giá là 2 nhân dân tệ cho mỗi triệu token đầu vào và 7 nhân dân tệ cho mỗi triệu token đầu ra, tương đương gấp 2,5 lần mức Flash ban đầu. Zhipu không nhấn mạnh điểm này trong thông báo chính thức, còn trên mạng xã hội, hầu hết các cuộc thảo luận đều xoay quanh việc đổi tốc độ lấy chi phí.

Tính ngược theo hệ số 2,5, giá đầu ra của Flash rơi vào khoảng 2,8 nhân dân tệ mỗi triệu token. Với một nghiệp vụ Agent tiêu thụ trung bình 1 tỷ token đầu ra mỗi ngày, chi phí đầu ra dùng Flash khoảng 84.000 nhân dân tệ một tháng, chuyển sang FlashX khoảng 210.000 nhân dân tệ — khoản chênh lệch 126.000 nhân dân tệ mua lấy cùng một khối lượng công việc nhưng làm nhanh hơn. Có đáng hay không phụ thuộc vào việc nghiệp vụ có đang bị nghẽn bởi độ trễ token đầu tiên và độ dài hàng đợi hay không: với sản phẩm hội thoại, phụ đề thời gian thực, hoàn thiện mã — những trường hợp không chịu được một giây trễ — 200 token/giây và hơn bốn mươi token/giây là hai trải nghiệm khác hẳn nhau; còn với xử lý theo lô ngoại tuyến, phân tích tài liệu, chạy dữ liệu ban đêm — chậm thêm vài phút không tốn kém gì — thì tiếp tục dùng Flash vẫn hợp lý hơn.

200 token/giây đến từ đâu

Lời giải thích của Zhipu là dựa trên nền tảng năng lực suy luận của 100.000 chip nội địa, cộng thêm việc tăng cường tối ưu hóa suy luận. Câu này không được nói rõ: tối ưu hóa nằm ở giải mã suy đoán, điều phối song song hay sắp xếp bộ nhớ đệm — thông báo không nêu; con số 100.000 chip là của riêng cụm máy chủ hay bao gồm cả đối tác — cũng không được công bố.

Phiên bản tiền nhiệm của FlashX có một lý lịch công khai. GLM-5.3-Flash từng chạy dưới tên mã Ox Alpha trong giới lập trình viên nước ngoài một thời gian, lượng gọi từng được Zhipu cho biết là vượt DeepSeek hơn gấp đôi. Từ Ox Alpha đến Flash rồi đến FlashX, nước đi của Zhipu trên tuyến sản phẩm này khá nhất quán: trước tiên dùng giá thấp để gom lượng gọi, nắm rõ hình dạng tải thực tế, sau đó chia theo tốc độ để thu tiền. Khi GLM-5.3 bản chính thức ra mắt, giá mỗi triệu token đầu ra niêm yết 4,4 đô la Mỹ; phân khúc Flash cắt tham số kích hoạt xuống còn 18 tỷ để ép chi phí; FlashX là một nấc tiếp theo trên cùng đường cong đó, nghiêng về phía tốc độ.

Tín hiệu từ việc tăng giá

Động thái mặc định của các mô hình lớn nội địa Trung Quốc hơn một năm qua là giảm giá, ai giảm trước người đó giành được lượng dùng. FlashX đi ngược lại: cùng một năng lực nhưng định giá cao hơn, điểm bán được viết thành tốc độ. Cách làm này chỉ đứng vững khi nguồn cung phía suy luận không còn rẻ vô hạn, và phần dư công suất xử lý đồng thời trong cụm máy chủ tự nó trở thành thứ có thể định giá.

Có trụ được hay không phụ thuộc vào hai điều: các đối thủ nội địa cùng phân khúc có điều chỉnh giá theo trong vài tuần tới hay không, và FlashX có giữ được giới hạn 200 token/giây trong các khung giờ tải cao hay không. Dữ liệu kiểm tra tải từ bên thứ ba hiện chưa được công bố.

Nguồn tham khảo: tài liệu nền tảng mở của Zhipu, thông báo chính thức của Zhipu, CocoLoop, Sina Technology, Chinaz; thông số tốc độ và ngữ cảnh được đối chiếu theo tài liệu chính thức, giá theo các nguồn tin công khai.