Qwen Pangkas Harga AI Suara hingga 95%

Tim Qwen milik Alibaba merilis rangkaian model suara Qwen-Audio-3.1 pada 23 September, sekaligus meluncurkan lima model yang mencakup pengenalan, sintesis, obrolan real-time, dan pembuatan audio. Bersamaan dengan peluncuran ini, Qwen memangkas harga di seluruh lini produk suaranya: sintesis suara (TTS) turun sekitar 70%, suara real-time (Realtime) turun sekitar 85%, dan pengenalan suara (ASR) turun hingga 95%.

Kelima model ini terbagi dalam dua kelompok. Tiga di antaranya merupakan pembaruan dari lini produk yang sudah ada:

  • Qwen-Audio-3.1-ASR: satu model yang mendukung 30 bahasa dan 16 dialek bahasa Mandarin. Qwen mengklaim meraih hasil terbaik pada 11 subset uji dialek, dengan peningkatan signifikan pada dialek yang sulit seperti dialek Wenzhou, serta waktu respons awal sekitar 160 milidetik;
  • Qwen-Audio-3.1-TTS: sintesis multibahasa dengan kemampuan transfer warna suara lintas bahasa, dan pengguna bisa menentukan nada bicara lewat bahasa alami — misalnya meminta model "membacakan dengan nada tegas dan tidak terbantahkan";
  • Qwen-Audio-3.1-Realtime: obrolan dupleks penuh yang bisa mendengarkan sambil berbicara dan dapat disela kapan saja, dengan dukungan pemanggilan tools; Qwen mengklaim model ini memperlambat kecepatan bicaranya saat mendeteksi suasana hati pengguna sedang turun.

Dua model lainnya adalah produk baru:

  • TTS-Next: kerangka kerja terpadu yang menggabungkan model bahasa dengan model difusi untuk menghasilkan suara manusia, efek suara, dan musik latar sekaligus, ditujukan untuk audiobook, podcast, gim, dan iklan;
  • ASR-Next: dapat membedakan pembicara dalam audio multi-orang, memberikan stempel waktu dan teks yang selaras, serta mengenali emosi, suara lingkungan, dan suara mesin untuk membuat deskripsi audio, penentuan lokasi kejadian, dan tanya-jawab berbasis audio.

Rapor dialek

Dalam materi peluncurannya, Qwen memaparkan beberapa data terkait dialek: rata-rata tingkat kesalahan karakter untuk pengenalan suara dialek Mandarin sebesar 10,38%, dan rata-rata akurasi kalimat semantik untuk terjemahan dialek sebesar 82,10%. Angka-angka ini berasal dari pengujian internal Qwen sendiri; komposisi data ujinya belum diungkap secara lengkap, dan belum ada hasil replikasi dari pihak ketiga.

Bagi pengembang di China, pengenalan dialek adalah kebutuhan nyata. Di layanan pelanggan, hotline pemerintah, dan siaran langsung e-commerce di tingkat kabupaten, pengenalan bahasa Mandarin standar biasanya akurat, tetapi begitu masuk dialek sering kacau — ini menjadi salah satu titik yang sering menghambat penerapan produk suara. Dengan memasukkan 16 dialek ke dalam satu model, setidaknya menghilangkan kerepotan harus berganti model sesuai wilayah.

Dibandingkan dengan ElevenLabs

Untuk lini sintesis suara, pembanding yang biasa dipakai di pasar global adalah ElevenLabs. Layanan routing pihak ketiga, OrcaRouter, merangkum data harga: TTS Plus dari Qwen-Audio-3.0 generasi sebelumnya sekitar 27,6 dolar AS per juta karakter, dan tingkat Flash sekitar 15 dolar AS; sementara Eleven v3 dari ElevenLabs dibanderol sekitar 100 dolar AS per juta karakter untuk harga standar dan sekitar 50 dolar AS untuk tingkat Flash.

Dengan perhitungan kasar berdasarkan "pemangkasan sekitar 70%", tingkat Plus di versi 3.1 akan berada sedikit di atas 8 dolar AS per juta karakter. Ini hanya perkiraan — pengumuman resmi hanya menyebutkan persentase penurunan, sementara harga baru yang pasti akan mengikuti daftar harga platform Bailian milik Alibaba Cloud.

Dari sisi kualitas, data arena suara Artificial Analysis pada Agustus menunjukkan Qwen-Audio-3.0-TTS-Plus memiliki skor Elo 1234, sementara Eleven v3 mencatat 1168. Model TTS versi 3.1 belum masuk ke arena publik mana pun, sehingga untuk saat ini kualitas audionya — apakah meningkat atau menurun — hanya bisa diketahui dari klaim vendor sendiri.

Digunakan di mana

Kali ini Qwen memasarkan model suaranya bersama sejumlah produknya sendiri: agen coding Qoder, Qwen Office, serta perangkat keras seperti QwenNote, A2, Eva, kacamata AI Qwen, dan kacamata AI Leqi. Perangkat seperti kacamata dan alat perekam biasanya memanggil API suara berdasarkan menit atau jumlah panggilan, sehingga penurunan harga 85% hingga 95% untuk pengenalan dan obrolan real-time paling langsung memengaruhi biaya layanan per perangkat bagi produsen perangkat keras.

Obrolan real-time mendapat pemangkasan harga terbesar kedua. Panggilan suara real-time biasanya harus menjalankan pengenalan, inferensi, dan sintesis secara bersamaan, menjadikannya salah satu kategori dengan biaya per unit yang relatif tinggi di antara produk suara. Apakah penurunan harga ini memungkinkan asisten suara tetap terbuka gratis bagi pengguna dalam jangka panjang akan bergantung pada kebijakan harga masing-masing mitra pada kuartal berikutnya.

Sumber: pengumuman resmi Qwen, IT Home, The Decoder, CocoLoop, dan rangkuman harga OrcaRouter. Persentase penurunan harga dan data uji dialek merupakan angka resmi dari Qwen; harga generasi sebelumnya dan harga ElevenLabs dihimpun oleh pihak ketiga; skor arena mengikuti papan peringkat publik Artificial Analysis.