Baseten Pakai Agen AI untuk Menulis Inference Engine, Lebih Cepat 90% dari vLLM

Penyedia layanan inferensi Baseten merilis tulisan di blog teknik mereka pada 2 Oktober: mereka menggunakan Claude Code untuk menjalankan Fable 5, membuat agen AI menulis dari nol sebuah inference engine yang hanya melayani satu model, dan mesin ini mengalahkan vLLM di semua pola traffic yang diuji.

Engine ini diberi nama VibeQwen, dibuat khusus untuk melayani Qwen-3.6-35B-A3B milik Alibaba. Penulisnya, Shawn Rushefsky, menulis dalam postingan tersebut:

"the generated engine, called VibeQwen, outperformed vLLM across all tested traffic patterns, and by very large margins in some cases"

(engine yang dihasilkan, bernama VibeQwen, mengungguli vLLM di semua pola traffic yang diuji, dan dengan selisih yang sangat besar dalam beberapa kasus)

Dari Mana Angka-Angka Ini Berasal

Perangkat keras uji adalah Nvidia B200, pembandingnya vLLM 0.25.1, dan alat load-testing yang dipakai adalah AIPerf. Beberapa hasilnya:

  • Decoding single-stream mencapai 1792 TPS, dibandingkan 943 TPS pada vLLM, sekitar 90% lebih cepat;
  • Latensi token pertama turun dari 28 milidetik menjadi 12 milidetik, sekitar 2,3 kali lebih cepat;
  • Pada 32 concurrent stream, throughput-nya 71% lebih tinggi.

Dari sisi biaya, pengembangan VibeQwen memakan waktu sekitar satu minggu, menghabiskan sekitar 1,7 miliar token (sebagian besar cache hit) dan sekitar 200 jam B200, dengan total biaya pada kisaran ribuan dolar AS.

Metode yang sama juga dicoba sekali lagi untuk image segmentation. Hasil keduanya diberi nama Sammie, melayani SAM 3.1 milik Meta, dan berjalan di H100. Prosesnya selesai dalam beberapa hari, menghabiskan biaya beberapa ratus dolar AS dan sekitar 200 juta token. Pada 32 concurrent stream, throughput-nya 50% lebih tinggi dibanding server referensi resmi Meta, mencapai 91 gambar per detik.

Apa yang Sebenarnya Dilakukan Agen AI

Baseten memperluas framework internal mereka bernama MetaInfer menjadi serving stack yang lengkap, lalu membiarkan agen AI mengisi bagian yang tersisa. Agen ini bisa merujuk pada implementasi open-source yang sudah ada sebagai referensi, dan setiap kali melakukan perubahan, agen menjalankan load test dengan AIPerf lalu memutuskan langkah berikutnya berdasarkan angka hasilnya.

Ada satu batasan yang ditulis secara sangat spesifik: setiap perubahan yang berpotensi mengubah presisi output mengharuskan agen berhenti dan meminta persetujuan manusia. Drift numerik kecil adalah salah satu hal paling sulit dideteksi dalam inference engine, dan jika peningkatan kecepatan mengorbankan presisi, hal itu tidak akan terlihat di papan skor benchmark. Gerbang pengaman ini dirancang justru untuk mencegah skenario itu.

Postingan blog ini juga menetapkan batasannya sendiri. VibeQwen dan Sammie masih berupa eksperimen — keduanya belum pernah menangani traffic produksi. Perbandingan untuk Sammie lebih kasar, dan penulisnya sendiri mengakui angka tersebut hanya bisa dianggap sebagai "bukti yang bersifat indikatif": kedua sisi menggunakan arsitektur dan akselerator yang berbeda, dan tidak ada uji terkontrol yang dilakukan.

Apa Artinya Ini bagi Tim AI di Tiongkok

VibeQwen menyasar model Qwen yang open-source, dan kebetulan sebagian besar layanan produksi di Tiongkok juga berjalan di atas kombinasi Qwen dengan vLLM atau SGLang, sehingga angka-angka ini relevan langsung dengan pekerjaan harian banyak tim.

Ada baiknya membandingkan ekonomi dari dua pendekatan ini. Engine serba guna harus melayani ratusan arsitektur model, sehingga banyak optimasi agresif yang spesifik untuk satu arsitektur tidak bisa diterapkan; engine khusus hanya berfokus pada satu model, sehingga bisa menyesuaikan kernel attention, routing MoE, dan strategi scheduling sepenuhnya mengikuti bentuk arsitektur 35B-A3B. Dulu membuat engine khusus membutuhkan waktu berbulan-bulan untuk satu tim; kali ini Baseten memampatkannya menjadi satu minggu dan beberapa ribu dolar AS — menurut perhitungan kasar, lebih murah daripada gaji satu bulan seorang inference engineer.

  1. Engine terikat erat dengan model. Begitu Qwen diupgrade dengan perubahan arsitektur, engine kemungkinan besar harus dibuat ulang dari awal.
  2. Pengujian hanya mencakup B200. Jenis akselerator yang tersedia di Tiongkok sangat beragam, dan blog ini tidak memberikan data apakah proses yang sama bisa direplikasi di hardware lain.
  3. Stabilitas long-tail, fragmentasi memori, dan penanganan request yang tidak normal — hal-hal yang penting bagi lingkungan produksi — belum tentu tercakup dalam load test.

Meski begitu, pendekatan "setiap model andalan memiliki engine khusus yang dibuat otomatis" kini sudah punya satu contoh yang bisa diverifikasi. Apakah posisi vLLM akan bergeser dari "andalan produksi" menjadi "baseline dan cadangan" akan bergantung pada apakah ada tim yang benar-benar menerapkan engine semacam ini ke produksi dan mempublikasikan data selama beberapa bulan.

Sumber: Blog teknik Baseten, CocoLoop; TPS, latensi token pertama, throughput concurrent, konsumsi token, dan jam GPU diverifikasi berdasarkan blog Baseten.