Poolside membuka model kode 118B

Poolside tidak merilis model raksasa dengan triliunan parameter. Laguna S 2.1 adalah model kode MoE dengan 118B parameter total dan 8B parameter aktif, bobotnya tersedia di Hugging Face, dan perusahaan mengatakan model ini dapat dijalankan sampai pada satu NVIDIA DGX Spark.

Nilai beritanya ada pada rute deploy. Perusahaan Barat akhirnya memiliki model coding open-weight yang bisa di-host sendiri. Namun Poolside tidak mengklaimnya mengalahkan GPT atau Claude. Skor Terminal-Bench 2.1 resminya 70,2%, masih tertinggal dari model tertutup terdepan.

Ukuran yang bisa dipasang

Poolside menyebut Laguna S 2.1 mendukung konteks hingga 1M token dan berjalan dari awal pelatihan ke rilis dalam kurang dari sembilan minggu. Angka utamanya: Terminal-Bench 2.1 70,2%, SWE-Bench Multilingual 78,5%, SWE-Bench Pro public dataset 59,4%, dan DeepSWE 40,4%.

Angka itu perlu dibaca sesuai konteks. Skor 70,2% berasal dari agent harness Poolside sendiri. Skor DeepSWE 40,4% adalah mode thinking. Beberapa perbandingan memakai skor tertinggi dari vendor, leaderboard, atau pihak ketiga.

Kutipannya bicara soal kebiasaan kerja

What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent.

Maksud Pengming Wang sederhana: peningkatan ini menekan verifikasi, ketekunan, dan kebiasaan tidak berhenti sebelum pekerjaan benar-benar selesai.

Poolside memberi dua contoh: sesi 50 menit dengan 181 langkah untuk membuat mesin render HTML/CSS sederhana, dan optimasi harness internal yang meningkatkan kecepatan 5,2% serta mengurangi alokasi memori sekitar 70%.

Celah open-weight

Momentum model kode open-weight belakangan banyak datang dari Kimi, Qwen, DeepSeek, dan MiniMax. Laguna S 2.1 mengambil posisi tengah: lebih kuat untuk tugas panjang dibanding kelas 30B, tetapi lebih mudah dioperasikan daripada model triliunan parameter.

Model card Hugging Face mengonfirmasi lisensi OpenMDW-1.1 untuk varian NVFP4. vLLM Recipes mencatat bobot BF16 sekitar 235GB, sehingga checkpoint terkuantisasi lebih realistis untuk desktop atau node multi-GPU.

Batasannya penting

Poolside juga menulis batasannya: kemungkinan overfit pada format tool internal ketika dipakai di harness pihak ketiga, JSON yang rusak pada nested tool calls, dan mode thinking yang dapat berjalan terlalu lama.

OpenRouter menyediakan endpoint gratis 256K dan endpoint 1M-context berbayar dengan harga ,10 input, ,20 output, dan ,01 cache-read per juta token. Murah, tetapi tugas agent panjang bisa memakai ratusan ribu token output.

Ujiannya ada di repositori

Hal berikutnya yang perlu dilihat: reproduksi komunitas di Hugging Face, stabilitas vLLM/Ollama/SGLang, performa pada repositori nyata, dan apakah model Laguna berikutnya memperkecil selisih Terminal-Bench.

Laguna S 2.1 bukan pembunuh model tertutup. Ia adalah opsi yang mudah dijelaskan ke tim pengadaan: kode tetap lokal, pekerjaan panjang bisa dijalankan, lisensi terbaca, biaya bisa dihitung, dan selisih kemampuan cukup kecil untuk diuji di proyek nyata.

Sumber: blog resmi Poolside, model card Hugging Face, vLLM Recipes, CocoLoop, The Next Web; memeriksa ukuran model, parameter aktif, jendela konteks, cakupan benchmark, hardware pelatihan, lisensi, jalur deployment, dan batasan yang dipublikasikan.