StepFun Rilis Step 5 Preview, Klaim Biaya 1/8 dari Opus 5

StepFun merilis model fondasi andalan generasi barunya, Step 5 Preview, pada 20 September. Model ini langsung tersedia di produk milik perusahaan sendiri dan lewat API, dengan bobot penuh dijadwalkan open source pada 15 Oktober.

Model ini menggunakan arsitektur sparse MoE (mixture of experts) dengan total 600B parameter dan 27B parameter aktif per token, jendela konteks 1 juta token, serta dukungan native untuk input teks dan visual. Materi peluncuran menyebutkan arah penggunaan secara spesifik: pemrograman berbantuan AI, rekayasa perangkat lunak, pekerjaan pengetahuan profesional, dan sektor keuangan.

Skor Benchmark dan Uji Internal

Pada Indeks Kecerdasan Gabungan Artificial Analysis, Step 5 Preview meraih 44 poin, masuk tiga besar model open-weight dunia. Skor benchmark publik lainnya: GPQA Diamond 93,5%, Terminal-Bench v2.1 85,0%, BrowseComp 88,7%, dan benchmark multimodal MMMU-Pro 76,0%. StepFun juga menyebut model ini meraih hasil terbaik atau kedua terbaik pada benchmark seperti AA-LCR dan CyberGym.

Ada kumpulan angka lain yang perlu dilihat secara terpisah. StepFun juga merilis skor StepCodeBench dan FinStepBench, dua benchmark yang dibangun sendiri oleh perusahaan. StepCodeBench mencakup 553 repositori kode, 9 kategori tugas, 20 domain aplikasi, dan 33 bahasa pemrograman, digunakan untuk menguji tugas pengembangan nyata seperti perbaikan bug, pengembangan fitur, refactoring kode, dan konfigurasi lingkungan. StepFun sendiri mencatat dalam materinya bahwa benchmark internal ini dirancang dengan tujuan berbeda dari leaderboard publik, dan hasil dari setup yang berbeda tidak bisa dibandingkan secara langsung.

Soal kemampuan agentic, StepFun mengklaim model dapat menjalankan tugas berkelanjutan secara otonom selama lebih dari 3 jam, mendukung debugging kode, akses port serial, pengambilan tangkapan layar, akses kamera, dan simulasi operasi mouse. Klaim semacam ini saat ini belum ada reproduksi dari pihak ketiga; angka yang bisa diverifikasi publik hanya skor benchmark yang dipublikasikan.

Klaim Biaya, dan Rincian di Baliknya

Kalimat yang paling banyak dikutip dari peluncuran ini adalah biaya per tugas hanya seperdelapan dari Claude Opus 5 milik Anthropic. Angka ini berasal dari StepFun sendiri, dan materi publik tidak mencantumkan dasar perhitungannya—berapa jumlah tugas, distribusi tingkat kesulitan seperti apa, apakah dihitung berdasarkan harga API resmi atau penggunaan aktual. Tidak satu pun dari itu dijelaskan.

Menerapkan rasio ini ke skenario konkret: jika sebuah tim mengeluarkan 100.000 yuan per bulan untuk inferensi Opus 5, seperdelapan dari itu berarti sekitar 12.500 yuan untuk Step 5 Preview, menghemat hingga skala jutaan yuan dalam setahun. Perhitungan ini hanya berlaku jika distribusi tugas sama dengan yang digunakan StepFun saat menghitungnya—dan itulah bagian yang tidak diungkapkan. Bagi tim yang berencana bermigrasi, menjalankan sendiri tugas yang sama setelah bobot dirilis pada 15 Oktober akan lebih dapat diandalkan daripada mengutip angka kelipatan ini.

Pilihan objek pembanding juga menunjukkan positioning. StepFun tidak membandingkan dengan model open-weight lain, melainkan memilih salah satu model closed-source kelas atas dengan harga tertinggi.

Jendela Waktu Satu Bulan

Versi preview dirilis lebih dulu lewat API, sementara bobot resmi baru menyusul sebulan kemudian—pola yang makin banyak dipakai perusahaan Tiongkok tahun ini: kuasai leaderboard dan siklus berita dulu, baru rilis bobot belakangan. Risikonya, dalam rentang satu bulan itu, model open-weight andalan sekelas bisa muncul kapan saja, dan tidak ada yang bisa menjamin peringkat 44 poin ini akan bertahan sampai 15 Oktober.

Dari sisi rekayasa, konfigurasi 600B total parameter dengan 27B aktif relatif ramah untuk deployment: jejak aktivasi 27B berarti inferensi multi-GPU dalam satu node menjadi memungkinkan, tanpa perlu menyiapkan sumber daya seperti untuk model dense 600B. Ini juga menjadi prasyarat agar bobot bisa dibuka sama sekali—jika jumlah parameter naik lebih jauh lagi, nilai praktis open source akan banyak tergerus oleh hambatan deployment.

StepFun belum mempublikasikan ketentuan lisensi maupun harga API kali ini. Kedua hal ini akan menentukan berapa banyak orang yang benar-benar akan menggunakannya setelah 15 Oktober.

Sumber: pengumuman resmi StepFun, Ifeng Technology, CocoLoop, Sina Technology. Jumlah parameter, skor Indeks Kecerdasan Gabungan Artificial Analysis, dan tanggal rilis open source telah diverifikasi sesuai pernyataan resmi; kelipatan biaya dan hasil benchmark internal merupakan data sepihak dari StepFun.