Model kecil Ling terbaru dari InclusionAI mudah dibaca sebagai rilis efisiensi parameter. Sasaran sebenarnya lebih spesifik: fondasi runtime untuk agen lokal.
Pada 11 Agustus, tim Ling dari Ant Group membuka Ling-3.0-tiny. Jiemian melaporkan angka dasarnya: total 7.9B parameter, hanya 1.3B parameter aktif per token, serta bobot BF16, FP8, dan INT4. Kartu model Hugging Face, halaman ModelScope, dan dokumentasi SGLang memberi rincian deployment yang lebih keras.
“We are introducing Ling-3.0-tiny, a lightweight hybrid reasoning MoE model”
Mengapa model kecil bicara agen
Ling-3.0-tiny memakai tumpukan bergantian 3:1 antara Kimi Delta Attention dan Multi-Head Latent Attention. Lapisan MoE FFN-nya memiliki 128 routed experts; setiap token mengaktifkan 8 routed experts dan 1 shared expert.
Tujuannya jelas: konteks panjang, memori rendah, dan tugas agen yang memakai alat harus berjalan bersama. Model chat kecil bisa murah, tetapi sesi coding panjang, pemanggilan alat, dan keputusan bertahap sering membuka batas perencanaan dan konteks. Ling-3.0-tiny ditempatkan untuk agentic workflows, bukan chat sekali jalan.
Deployment lokal adalah inti rilis
Kartu model menyebut validasi pada NVIDIA DGX Spark, Apple Silicon MacBook, dan Mac mini. Dengan FP8, model mencapai sekitar 100-105 tokens/s di DGX Spark dan 86-90 tokens/s di M4 Pro MacBook, dengan puncak memori sekitar 8.34 GiB pada konteks 8K.
Angka ini penting karena menunjuk ke mesin yang sudah dimiliki pengembang. MacBook baru atau workstation kecil mulai cukup untuk menjalankan agen lokal dengan kemampuan reasoning. Data bisa tetap di perangkat, sementara biaya bergeser dari token cloud ke perangkat dan listrik.
Batasnya juga jelas. Resep latensi rendah SGLang untuk konteks 256K YaRN dan decoding spekulatif NEXTN masih menyebut GPU kelas 141GB atau node Blackwell satu GPU. Angka MacBook adalah lingkup FP8, hardware lokal, dan konteks 8K.
Benchmark memberi batas
Kartu model melaporkan skor 25 pada Artificial Analysis Intelligence Index v4.1.1 dan 16 pada Agentic Index. Dalam pengujian itu, kecepatan output melewati 160 tokens/s dan respons 500 token memerlukan sekitar 18 detik end-to-end, termasuk waktu reasoning.
Ini bukan skor model flagship. Argumennya adalah efisiensi per parameter aktif. Ling-3.0-flash lebih tinggi di platform yang sama, tetapi jauh lebih besar. Versi tiny lebih mirip kernel eksekusi lokal: bisa berjalan, memanggil alat, dan tinggal aktif dalam waktu lama.
Titik berikutnya bersifat praktis: stabilitas dukungan SGLang dan vLLM, performa INT4 pada perangkat konsumen, serta integrasi ke IDE, otomasi browser, dan alat internal perusahaan. Kartu model menunjukkan cara memulai; tugas panjang akan menentukan nilainya.
Sumber: kartu model Hugging Face, ModelScope, Jiemian, Artificial Analysis, CocoLoop, dokumentasi SGLang; verifikasi mencakup total 7.9B parameter, 1.3B parameter aktif, bobot BF16/FP8/INT4, arsitektur KDA/MLA dan 128 expert, kecepatan DGX Spark/M4 Pro lokal, lingkup memori 8K, indeks Artificial Analysis, dan lingkup deployment SGLang 256K.