Fireworks Ubah Kimi K3 Jadi Ember-1, Token Turun 40%

Penyedia layanan inferensi Fireworks AI merilis Ember-1, yang dibangun di atas model bobot terbuka Kimi K3 milik Moonshot AI. Fireworks tidak mengubah arsitektur model, hanya melakukan post-training, dengan satu tujuan: membuat K3 "berpikir" lebih sedikit tanpa menurunkan kualitas jawaban. Menurut perusahaan, cara ini memangkas token yang dihasilkan sekitar 40% tanpa penurunan kualitas yang berarti.

Ember-1 saat ini tersedia sebagai research preview di Fireworks Serverless dan hanya bisa diakses lewat API. Bobot model dan kode pelatihannya tidak dirilis, sehingga tidak bisa di-hosting sendiri. Harganya sama dengan K3 di Fireworks: 3 dolar AS per juta token input, 0,30 dolar untuk input yang di-cache, dan 15 dolar untuk output.

Yang dihemat terutama proses "berpikir"

Dalam blog resminya, Fireworks menjelaskan motivasi di balik Ember-1: pengguna menyukai kemampuan coding K3, tetapi rantai penalarannya terlalu panjang sehingga biaya sulit ditekan saat dipakai dalam alur kerja coding otomatis. Menurut data internal perusahaan, model penalaran seperti K3 kadang menghabiskan lebih dari 90% outputnya hanya untuk penalaran internal sebelum memberi jawaban; ketika agen memanggil tool langkah demi langkah, model juga mengulang kembali seluruh proses berpikir sebelumnya di setiap langkah.

Cara paling langsung adalah menurunkan level reasoning effort K3, dan Fireworks mengaku sudah mencobanya — tapi kualitas turun terlalu banyak di level rendah. Ember-1 mengambil jalan berbeda. Perusahaan menjelaskan:

"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."

Pelatihan mencakup matematika, coding, mengikuti instruksi, percakapan, pencarian, pemanggilan tool, dan rekayasa perangkat lunak, dengan lebih dari 50 eksperimen pelatihan dan lebih dari 200 evaluasi, semuanya dijalankan di infrastruktur Serverless Training milik Fireworks sendiri menggunakan data mereka sendiri. Fireworks menyebut metode spesifiknya baru dan belum dipublikasikan, sehingga saat ini belum bisa direplikasi pihak luar.

Skor benchmark naik di sebagian, turun di sebagian lain

Fireworks membandingkan Ember-1 dengan tiga tingkat K3:

BenchmarkK3 LowK3 HighK3 MaxEmber-1
Terminal Bench 2.176,4%77,6%80,9%82,0%
SWE-bench Verified80,4%86,0%93,2%92,2%
DeepSWE 1.155,8%62,8%66,4%75,2%

Di DeepSWE, Ember-1 unggul hampir 9 poin persentase dari K3 Max; di SWE-bench Verified, justru tertinggal sekitar 1 poin. Data yang dikutip media pihak ketiga juga menunjukkan Ember-1 sedikit di bawah K3 Max di SWE-Interact. Semua ini adalah hasil pengujian internal Fireworks, dan belum ada verifikasi dari lembaga evaluasi independen.

Data yang lebih meyakinkan justru datang dari lalu lintas produksi. Fireworks menjalankan uji A/B bersama dua klien pada trafik coding nyata, dan menemukan penurunan token per tugas sekitar 35% secara keseluruhan. Set data paling lengkap menunjukkan token penalaran turun 71,3%, total token turun 39%, dengan skor tugas 0,753 berbanding 0,751. Salah satu klien sudah memakai Ember-1 di lingkungan produksi, meski nama perusahaannya tidak diungkap.

Kalkulasi kasar biaya

Karena harga per token sama, penghematan sepenuhnya berasal dari lebih sedikitnya token yang dihasilkan. Berdasarkan data A/B di atas, biaya output K3 Max per tugas diperkirakan sekitar 0,74 dolar AS, sementara Ember-1 sekitar 0,45 dolar. Untuk tim yang menjalankan 10.000 tugas coding per hari, biaya output harian diperkirakan turun dari sekitar 7.400 dolar menjadi sekitar 4.500 dolar — selisih lebih dari 80.000 dolar per bulan. Perhitungan ini hanya mencakup token output, belum termasuk input dan cache, sehingga penghematan aktual tergantung panjang tugasnya.

Bagi developer di China, arti penting Ember-1 lebih terletak pada metodenya. K3 adalah model bobot terbuka yang bisa di-post-training siapa saja, dan Fireworks membuktikan bahwa "memampatkan panjang penalaran" bisa dijual sebagai produk tersendiri. Penyedia layanan inferensi di China juga punya model terbuka serupa seperti K3, DeepSeek, dan Qwen, sehingga patut ditunggu apakah versi "hemat token" serupa akan bermunculan. Untuk memakai Ember-1 sendiri dari China, panggilannya harus lewat API luar negeri, sehingga latensi dan kepatuhan regulasi perlu dievaluasi sendiri oleh penggunanya.

Sumber: blog resmi Fireworks AI, MarkTechPost, CocoLoop, halaman model Fireworks; diverifikasi terhadap tiga skor benchmark, data token dan skor uji A/B, serta harga input/output per juta token.