Colibrì Jalankan GLM-5.2 di RAM 16GB Berkat SSD

Sebuah mesin inferensi open source bernama Colibrì belakangan ini melonjak hingga lebih dari 37 ribu star dan 4 ribu fork di GitHub. Yang dilakukannya sederhana: membuat model besar MoE dengan parameter mulai dari ratusan miliar hingga lebih dari satu triliun bisa berjalan di komputer orang biasa. Sebagai contoh, untuk GLM-5.2 dari Zhipu AI, proyek ini mencantumkan spesifikasi minimum RAM 16GB, dengan rekomendasi 24GB, dan GPU sifatnya opsional.

Proyek ini dibuat oleh Vincenzo Fornaro pada 1 Juli, ditulis sepenuhnya dalam bahasa C, tanpa dependensi eksternal saat dijalankan, dan berlisensi Apache 2.0. Versi 1.12.0 yang dirilis 20 September menggabungkan 81 pull request; versi 1.12.1 pada 24 September menggabungkan 96 lagi, 80 di antaranya dari kontributor luar.

Bobot disimpan di disk, dibaca lapis demi lapis sesuai kebutuhan

Ciri khas model MoE adalah total parameternya besar, tapi yang benar-benar dipakai per token hanya sebagian kecil. GLM-5.2 punya total 744 miliar parameter, namun setiap kali dipanggil hanya sekitar 40 miliar yang aktif. Pendekatan Colibrì adalah tidak memuat seluruh model ke RAM: bobot lengkap yang sudah dikuantisasi ke int4 disimpan di SSD NVMe — sekitar 372GB untuk GLM-5.2 dan sekitar 419GB untuk GLM-5.3.

Proyek ini memperlakukan VRAM, RAM, dan SSD sebagai satu lapisan penyimpanan terpadu, yang oleh penulisnya disebut "kompilasi bobot secara just-in-time". Teknik yang dipakai antara lain: cache least-recently-used per lapisan, menetapkan expert yang sering dipakai agar tetap menetap di memori, prefetch satu lapisan lebih awal untuk expert yang kemungkinan dibutuhkan lapisan berikutnya, menggabungkan expert yang dibutuhkan beberapa token menjadi satu kali baca disk, menumpangtindihkan (overlap) pembacaan disk dengan komputasi, serta dukungan pembacaan paralel bergaris (striping) di dua SSD sekaligus.

README-nya terang-terangan soal trade-off kecepatan: kalau penyimpanan cepat tidak tersedia, yang terjadi hanya perlambatan, bukan penurunan akurasi model — dan soal kecepatan sendiri, proyek ini "tidak memberi jaminan apa pun".

Seberapa cepat sebenarnya

Proyek ini memberikan beberapa hasil pengujian nyata:

  • 6x RTX 5090 dengan semua bobot menetap di memori: 5,8 sampai 6,8 token per detik
  • Desktop CPU-only dengan RAM 128GB, setelah cache dipanaskan: sekitar 1,8 token per detik
  • Satu unit RTX 5070 Ti: 1,07 token per detik
  • Mesin pengembangan milik penulis dengan RAM 25GB, cold start: 0,05 sampai 0,1 token per detik

Versi 1.11.0 yang dirilis pertengahan September menambahkan dukungan untuk DeepSeek V4.1 Flash — 552 miliar parameter, memakai 510GB ruang disk — dengan membaca bobot resmi langsung di mesin CPU-only tanpa konversi format. Penulis mencatat waktu cold-start untuk satu giliran turun dari 78,7 detik menjadi 25,1 detik, dan pada percakapan lima giliran kecepatannya stabil di 1,14 sampai 1,58 token per detik.

Fitur baru utama di 1.12.0 disebut mode brio: pemanggil memberi sejumlah pilihan jawaban tetap, lalu mesin langsung membaca probabilitas tiap pilihan alih-alih men-generate teks lewat sampling — jumlah token keluaran jadi nol, dan jawabannya tidak mungkin keluar dari pilihan yang diberikan. Bagi kebanyakan pengguna lokal, ini jauh lebih praktis dibanding menunggu balasan diketik token demi token.

Daftar model yang didukung nyaris seperti daftar model open source asal Tiongkok

Colibrì saat ini mendukung sembilan keluarga model: GLM-5.2/5.3 beserta GLM-5.3-Flash yang punya kemampuan visual, DeepSeek V4 Flash dan V4.1 Flash, Kimi K3, Qwen3.6 dan Qwen3.8-Flash-Next, ditambah Inkling dan OLMoE. Kecuali dua yang terakhir, semuanya berasal dari perusahaan Tiongkok — Zhipu AI, DeepSeek, Moonshot AI, dan Alibaba.

Bagi developer di Tiongkok, ini punya dua manfaat praktis. Pertama, data tetap di lokal: untuk kantor hukum, rumah sakit, dan pabrik yang tidak bisa mengirim dokumen ke cloud, satu workstation dengan RAM 128GB plus SSD 1TB sudah cukup untuk menjalankan model GLM 744 miliar parameter secara lokal. Kedua, menurunkan ambang batas: model seperti Kimi K3 dengan 2,8 triliun parameter — bobot int4-nya sekitar 1,6TB dan minimum RAM 32GB — sebelumnya nyaris mustahil dijalankan individu di mesin sendiri.

Batasannya juga sama jelasnya. Dengan kecepatan satu-dua token per detik, membuat balasan sepanjang seribu kata bisa memakan waktu lebih dari sepuluh menit; dokumentasi proyek tidak memberikan perkiraan soal keausan SSD akibat pembacaan acak berintensitas tinggi dalam waktu lama. Penulisnya sendiri juga mengingatkan bahwa percepatan dari speculative decoding adalah hasil empiris — belum tentu bisa direproduksi di mesin lain.

Sumber: README proyek Colibrì, catatan rilis Colibrì versi 1.11 hingga 1.12.1, QbitAI, CocoLoop; angka kecepatan mengikuti konfigurasi pengujian yang dipublikasikan pihak proyek, dan jumlah star diambil dari halaman GitHub.