Reflection AI Rilis Model Open-Weight 501B Beam

Reflection AI merilis model open-weight pertamanya, Beam. Ini adalah model sparse mixture-of-experts (MoE) dengan total 501 miliar parameter dan 23 miliar parameter aktif per token, yang difokuskan untuk tugas coding, penalaran, dan agentic. Perusahaan menyatakan bobot, laporan teknis, dan model card akan dirilis akhir bulan ini dengan lisensi Apache 2.0; model saat ini masih menjalani putaran terakhir red-teaming dan evaluasi, dan developer sudah bisa mendaftar akses awal di platform.reflection.ai.

Reflection didirikan oleh mantan peneliti DeepMind dan beroperasi secara stealth selama lebih dari setahun. Pada Juni tahun ini, perusahaan menandatangani kontrak komputasi dengan SpaceX senilai sekitar 6,3 miliar dolar AS secara total, atau sekitar 150 juta dolar AS per bulan.

Bagaimana Beam dilatih

Menurut blog resminya, Beam terdiri dari 52 layer, dan mid-training memperluas jendela konteksnya hingga 1 juta token. Pre-training menggunakan 23,8 triliun token yang berasal dari data web publik dan dataset berlisensi; token web mentah disaring secara berjenjang hingga sekitar 95% di antaranya dibuang.

Dari sisi komputasi, pre-training berjalan di 6.144 chip Nvidia GB300 selama kurang dari empat minggu; tahap reinforcement learning berikutnya beralih ke 10.500 chip GB300 dan berjalan empat minggu lagi, menghasilkan lebih dari 100 juta rollout dengan sekitar 1,3 miliar lingkungan sandbox. Reflection cukup percaya diri dengan skala RL run ini:

We believe this is one of the largest scale RL runs conducted by any open lab to date.

Artinya, mereka menganggap ini sebagai salah satu RL run berskala terbesar yang pernah dilakukan lab terbuka mana pun hingga saat ini. Blog tersebut juga menyebutkan bahwa semakin besar komputasi RL yang ditambahkan, semakin naik pula semua kemampuan model, dengan kata lain “belum terlihat tanda-tanda plateau”.

Dibandingkan dengan model open source Tiongkok

Reflection cukup terang-terangan soal siapa yang jadi pembanding utamanya: hampir semuanya model Tiongkok. Dalam tabel perbandingan resminya, Beam bersaing ketat dengan GLM 5.2 dari Zhipu, sambil mengklaim hanya memakai seperempat hingga sepertiga komputasi inferensi milik pesaingnya; untuk tugas coding dan agentic, Beam disebut mendekati Qwen 3.8-Max yang parameternya lebih dari 2 triliun.

Beberapa angka yang patut disimak:

BenchmarkBeamPembanding di Tabel
SWE-bench Verified80.9Inkling 77.6
Terminal Bench v2.180.1DeepSeek V4.1 Flash 90.6
SWE Bench Pro v2-Hard77.2Kimi K3 88.2
BrowseComp (dengan konteks)77.4Kimi K3 91.2
GPQA Diamond90.5Kimi K3 93.5

Dalam tabel ini, Beam tidak banyak menang. Pada pengoperasian terminal, software engineering tingkat sulit, dan pencarian web, Kimi K3 dan DeepSeek V4.1 Flash sama-sama memimpin sekitar sepuluh poin. Keunggulan utama yang ditonjolkan Reflection adalah efisiensi: 23 miliar parameter aktif tergolong kecil untuk level skor ini, sehingga biaya deployment bisa jauh lebih rendah.

Narasi media luar negeri menyebut ini sebagai “pertama kalinya startup AS membuat model yang bisa head-to-head dengan model open source papan atas Tiongkok”. Lebih dari setahun terakhir, papan atas leaderboard open-weight dikuasai DeepSeek, Qwen, Kimi, dan GLM, sementara di sisi AS, Meta mengalihkan fokus ke lini closed-source Muse, sehingga jarang ada model open source besar asal AS yang layak dibanggakan. Beam hadir untuk mengisi posisi itu.

Beberapa hal yang belum terjawab

Semua skor di atas berasal dari evaluasi internal Reflection sendiri; detail seperti setup pengujian dan jumlah sampling masih harus menunggu laporan teknis. Bobot modelnya belum dirilis, jadi komunitas belum bisa menjalankan benchmark secara independen.

Blog tersebut tidak menyebutkan harga API sama sekali, juga tidak menjelaskan platform inferensi mana yang akan menjadi tempat rilis pertama, hanya menyebut akan bekerja sama dengan “mitra distribusi ekosistem”. Bagi developer di Tiongkok, lisensi Apache 2.0 berarti bobot model bisa dipakai secara komersial dan di-fine-tune secara bebas setelah dirilis, tapi bobot lengkap dengan 501 miliar parameter membutuhkan VRAM yang besar, sehingga kebanyakan tim kemungkinan akan menunggu versi terkuantisasi atau hosting pihak ketiga.

Sumber: Blog resmi Reflection AI, Latent Space, CocoLoop, SiliconANGLE; jumlah parameter, komputasi pelatihan, dan seluruh skor benchmark mengacu pada data yang dipublikasikan di blog resmi Reflection.