Inferact, startup yang didirikan oleh anggota inti tim vLLM, merilis serangkaian pengujian inferensi: menjalankan Kimi K3 milik Moonshot AI pada 16 chip Google TPU v7 Ironwood mencapai kecepatan decoding satu jalur sebesar 709 token per detik, dibandingkan 452 token per detik pada kelompok pembanding 16 chip Nvidia GB200 — lebih cepat sekitar 57%.
Laporan pengujian dan kodenya dirilis bersamaan pada 23 September, dengan repositori inferact/tpu-megakernels dibuka sebagai open source di bawah lisensi Apache 2.0. Inferact, yang didirikan oleh tim inti vLLM, sebelumnya meraih pendanaan seed sebesar 150 juta dolar AS dengan valuasi 800 juta dolar AS, dipimpin oleh a16z dan Lightspeed.
Di atas kertas, GB200 lebih unggul
Mari lihat dulu spesifikasi mentah kedua sisi. Menurut angka dalam laporan, satu chip TPU v7 memiliki kinerja puncak BF16 sebesar 2,31 PFLOPS dan FP8 sebesar 4,61 PFLOPS, dengan HBM 206GB berbandwidth 7380 GB/s. Sebagai perbandingan, satu chip GB200 masing-masing mencapai 2,5 PFLOPS dan 5 PFLOPS, dengan HBM 186GB berbandwidth 8000 GB/s. GB200 unggul baik dari sisi kinerja komputasi maupun bandwidth; satu-satunya keunggulan TPU adalah kapasitas memori yang lebih besar 20GB.
Kimi K3 adalah model MoE dengan 92 lapisan, yang mekanisme atensinya menggabungkan Kimi Delta Attention dengan multi-head latent attention (MLA). Pengujian ini membagi model ke 16 chip menggunakan paralelisme tensor 4 arah dan paralelisme expert 8 arah.
Berikut perbandingan kecepatan mentah tanpa mengaktifkan speculative decoding:
| Ukuran batch | TPU v7 (megakernel) | GB200 (vLLM) |
|---|---|---|
| 1 | 249 | 127 |
| 2 | 392 | 227 |
| 4 | 515 | 373 |
| 8 | 865 | 636 |
Satuannya token per detik. Pada ukuran batch 1, TPU hampir dua kali lebih cepat; pada ukuran batch 8, selisihnya menyempit menjadi sedikit di atas 30%. Setelah mengaktifkan speculative decoding DSpark yang diusulkan DeepSeek, kecepatan satu jalur menjadi 709 berbanding 452, dengan waktu decoding per langkah sekitar 8,5 milidetik.
Kuncinya: menggabungkan 92 lapisan jadi satu program
Inferact menyebut pendekatannya sebagai megakernel. Pada kerangka kerja inferensi konvensional, komputasi setiap lapisan dipecah menjadi beberapa kernel independen yang dijalankan berurutan, dengan jeda di antara kernel-kernel tersebut — dan bobot (weight) baru bisa mulai dipindahkan dari memori ke chip setelah kernel terkait mulai berjalan.
Inferact menggunakan Pallas untuk menulis seluruh langkah decoding dari 92 lapisan tersebut sebagai satu program tunggal. Menurut laporan itu, satu megakernel menghapus batas antar-kernel, sehingga pemuatan bobot tidak lagi terikat pada kernel yang menggunakannya — proses prefetch bisa dimulai sejauh yang diizinkan oleh kapasitas memori on-chip. Saat decoding satu jalur, sebagian besar waktu chip dihabiskan untuk menunggu data, dan prefetch ini tepat mengisi celah tersebut; seiring ukuran batch naik dan porsi komputasi membesar, keuntungan dari teknik ini menyusut — sesuai dengan tren pada tabel di atas.
Manfaat sampingannya adalah waktu kompilasi: kompilasi XLA sebelumnya butuh lebih dari 30 menit, sementara megakernel hanya butuh kurang dari 90 detik. Untuk menunjukkan bahwa percepatan ini tidak mengorbankan akurasi, laporan tersebut menyertakan skor Kimi K3 di TPU: 94,4% pada GPQA-Diamond dan 97,2% pada GSM8K.
Kalkulasi kasar efisiensi per unit kinerja komputasi
Dengan menghitung kasar berdasarkan hasil speculative decoding satu jalur: kinerja puncak BF16 TPU v7 hanya sekitar 92% dari GB200, namun throughput token-nya 1,57 kali lebih tinggi — jika dikonversi ke output per unit kinerja puncak, TPU sekitar 1,7 kali lipat dari GB200. Jika dikonversi berdasarkan bandwidth, rasionya juga berada di kisaran 1,7 kali.
Angka ini perlu diberi catatan. Pihak GB200 menggunakan resep Kimi K3 yang dirilis publik oleh vLLM, jalur multi-kernel konvensional yang belum mendapat optimasi setara level megakernel. Laporan tersebut tidak menyertakan hasil GB200 dengan optimasi setara, sehingga belum bisa dipisahkan berapa banyak selisih ini berasal dari perangkat keras dan berapa banyak dari investasi perangkat lunak. Nvidia sendiri belum merespons angka-angka ini.
Bagi Moonshot AI, pengujian ini menawarkan jalur penerapan yang layak untuk Kimi K3 di perangkat keras non-Nvidia. Kimi K3 adalah model open-weight dengan 2,8 triliun parameter, skala yang membuat ambang batas untuk deployment mandiri cukup tinggi; dengan tersedianya kernel TPU open source, menyewa TPU di cloud untuk menjalankan K3 kini menjadi opsi tambahan.
Sumber: blog teknis Inferact, CocoLoop, repositori kode inferact/tpu-megakernels, QbitAI; angka throughput mengikuti metodologi pengujian 16-banding-16 chip dari Inferact, dan detail pendanaan berdasarkan pemberitaan publik.