階躍星辰 9 月 20 日發表新一代旗艦基礎模型 Step 5 Preview,即日起在自家產品與 API 上開放使用,完整權重訂在 10 月 15 日開源。
模型走的是稀疏 MoE 路線,總參數 600B,每個 token 啟用 27B,上下文視窗達 100 萬 token,原生支援文字與視覺輸入。發表資料把應用方向講得很具體:AI 程式開發、軟體工程、專業知識工作與金融場景。
榜單成績與自建基準
在 Artificial Analysis 綜合智慧指數上,Step 5 Preview 拿下 44 分,躋身全球開源模型前三名。其餘公開基準的成績為:GPQA Diamond 93.5%,Terminal-Bench v2.1 85.0%,BrowseComp 88.7%,多模態的 MMMU-Pro 76.0%。階躍星辰還提到在 AA-LCR、CyberGym 等基準上拿到最佳或次佳成績。
需要分開來看的是另一組數字。階躍星辰同時公布了 StepCodeBench 與 FinStepBench 兩項成績,這兩個基準由階躍星辰自行建構:StepCodeBench 涵蓋 553 個程式碼儲存庫、9 類任務、20 個應用領域與 33 種程式語言,用來測試修錯(Bug fix)、功能開發、程式碼重構、環境設定這類真實開發任務。自建基準的設計用意與公開榜單不同,不同設定下的結果也不具直接可比性,這一點階躍星辰自己在資料裡也寫明了。
在 Agent 能力方面,階躍星辰宣稱模型能自主執行超過 3 小時的連續任務,支援程式碼除錯、序列埠存取、擷取螢幕截圖、呼叫攝影機以及模擬滑鼠操作。這類描述目前缺乏第三方覆現驗證,外界能核對的只有公開榜單那幾項。
一筆帳,以及這筆帳的算法
發表中被引用最多的一句話是:單一任務成本僅為 Anthropic Claude Opus 5 的八分之一。這句話的來源是階躍星辰自己,公開資料並未標註測算依據——多少任務、什麼難度分布、是按 API 掛牌價還是實際用量計算,一項都沒寫。
把這個口徑套進具體情境算一遍:假設一個團隊每月在 Opus 5 上的推論支出是 10 萬元人民幣,按八分之一推算,換到 Step 5 Preview 大約是 1.25 萬元,一年省下的金額達百萬等級。這個數字成立的前提是任務分布與階躍星辰測算時一致,而這正是沒有公開的部分。對打算遷移的團隊來說,等 10 月 15 日權重釋出後自己跑一次同構任務,會比引用這個倍數更可靠。
比較對象的選擇也透露出定位。階躍星辰沒有拿另一款開源模型當參照,挑的是封閉模型第一梯隊裡單價最高的那一檔。
一個月的空窗期
Preview 版本先上 API,正式權重要再等一個月,這種節奏今年國內廠商用得越來越多:先搶佔榜單與話題聲量,再放出權重。風險在於這中間的一個月裡,同量級的開源旗艦隨時可能落地,44 分這個名次能否撐到 10 月 15 日,沒有人能打包票。
從工程角度看,600B 總參數、27B 啟用的配置對部署方相對友善,27B 的啟用量意味著單機多卡推論可行,不必按 600B 稠密模型的規格準備資源。這也是能把權重開放出來的前提條件,參數規模再往上拉,開源的實際意義就會被部署門檻吃掉不少。
授權條款與 API 定價,階躍星辰這次都沒有公布。這兩項將決定 10 月 15 日之後有多少人真的會把它裝起來用。
參考來源:階躍星辰官方發表、鳳凰科技、CocoLoop、新浪科技;參數規模、AA 綜合智慧指數得分與開源時間依官方口徑核對,成本倍數與自建基準成績均為階躍星辰單方資料。