GLM-5.3-FlashX dari Zhipu: 5x Lebih Cepat, Harga Naik 2,5x

Zhipu merilis GLM-5.3-FlashX pada 18 September, dengan akses API dibuka bersamaan di bawah ID model GLM-5.3-FlashX. Angka resmi yang diberikan perusahaan sebenarnya hanya satu: kecepatan output puncak mencapai 200 token per detik, yang menurut Zhipu lima kali lebih cepat dari GLM-5.3-Flash yang sudah ada.

Tingkat kemampuan model itu sendiri tidak berubah. Menurut dokumentasi platform terbuka, Flash dan FlashX berbagi spesifikasi yang sama: jendela konteks 1 juta token, output maksimum 128.000 token, input mendukung video, gambar, teks, dan berkas, sementara output berupa teks. Keduanya juga mendukung mode berpikir, pemanggilan tool, respons streaming, caching konteks, dan output terstruktur JSON. Perbedaannya ditulis secara gamblang: FlashX menukar biaya dengan throughput, sementara Flash mempertahankan harga per unit yang lebih murah.

Harga naik seiring kecepatan

Menurut laporan publik, harganya dipatok 2 yuan per juta token input dan 7 yuan per juta token output — sekitar 2,5 kali tarif Flash sebelumnya. Zhipu sendiri tidak banyak menyoroti poin ini dalam pengumumannya, tapi diskusi di media sosial hampir seluruhnya tertuju pada pertukaran "kecepatan demi biaya" ini.

Jika dihitung mundur dari kelipatan 2,5 kali, harga output tarif Flash berada di kisaran 2,8 yuan per juta token. Ambil contoh bisnis agent yang mengonsumsi 1 miliar token output per hari: dengan Flash, biaya output saja sekitar 84.000 yuan per bulan, sementara beralih ke FlashX menaikkannya menjadi sekitar 210.000 yuan. Selisih 126.000 yuan itu membeli pekerjaan yang sama namun diselesaikan lebih cepat. Apakah ini sepadan tergantung pada apakah bisnis tersebut terkendala oleh latensi token pertama dan panjang antrean: untuk produk percakapan, teks berjalan real-time, atau pelengkapan kode otomatis — jenis layanan yang tidak bisa menoleransi keterlambatan sedetik pun — 200 token per detik dan sekitar empat puluhan token per detik adalah dua pengalaman yang sangat berbeda. Sebaliknya, untuk pemrosesan batch offline, penguraian dokumen, atau tugas malam hari yang tidak masalah telat beberapa menit, Flash tetap pilihan yang lebih masuk akal.

Dari mana asal 200 token per detik

Penjelasan Zhipu adalah bahwa mereka menambahkan optimasi inferensi lebih lanjut di atas basis komputasi inferensi yang dibangun dari 100.000 unit chip buatan domestik. Pernyataan ini tidak dirinci lebih jauh — apakah optimasi tersebut terletak pada speculative decoding, penjadwalan paralel, atau pengaturan memori, tidak dijelaskan dalam pengumuman; apakah angka 100.000 chip itu mencakup klaster milik sendiri saja atau juga kapasitas mitra, juga tidak diungkapkan.

Pendahulu FlashX memiliki rekam jejak di luar negeri. GLM-5.3-Flash sebelumnya beredar di kalangan developer luar negeri dengan nama kode Ox Alpha, dengan volume pemanggilan yang menurut klaim Zhipu pernah melampaui dua kali lipat DeepSeek. Dari Ox Alpha ke Flash lalu ke FlashX, langkah Zhipu pada lini ini cukup konsisten: mula-mula gunakan harga murah untuk mengumpulkan volume pemanggilan, memahami bentuk beban kerja yang sesungguhnya, lalu mengenakan tarif bertingkat berdasarkan kecepatan. Saat versi resmi GLM-5.3 diluncurkan, harga output per juta token dipatok 4,4 dolar AS; tarif Flash memangkas parameter aktif menjadi 18 miliar untuk menekan biaya; FlashX adalah satu tingkat lagi pada kurva yang sama, kali ini bergerak ke arah kecepatan.

Sinyal dari kenaikan harga ini

Selama lebih dari setahun terakhir, langkah default para pembuat model bahasa besar domestik Tiongkok adalah menurunkan harga — siapa yang lebih dulu menurunkan harga, dialah yang merebut volume. FlashX bergerak sebaliknya: kemampuan yang sama, harga yang lebih tinggi, dengan daya jual yang sepenuhnya dibangun di atas kecepatan. Ini hanya masuk akal jika pasokan di sisi inferensi tidak lagi murah tanpa batas, dan kelonggaran konkurensi di dalam klaster itu sendiri telah menjadi sesuatu yang bisa diberi harga.

Apakah tren ini akan bertahan bergantung pada dua hal: apakah kompetitor domestik sekelas akan ikut menaikkan harga dalam beberapa minggu ke depan, dan apakah FlashX bisa mempertahankan batas 200 token per detik pada periode konkurensi tinggi. Data uji beban dari pihak ketiga belum dipublikasikan hingga saat ini.

Sumber: dokumentasi platform terbuka Zhipu, pengumuman resmi Zhipu, CocoLoop, Sina Technology, Chinaz; spesifikasi kecepatan dan konteks telah diverifikasi lewat dokumen resmi, harga mengikuti laporan publik.