StepFun(阶跃星辰)이 9월 20일 차세대 플래그십 파운데이션 모델 'Step 5 Preview'를 발표했다. 같은 날부터 자사 제품과 API에서 바로 사용할 수 있으며, 전체 가중치는 10월 15일 오픈소스로 공개될 예정이다.
이 모델은 희소 MoE(Mixture of Experts) 방식을 채택했으며, 총 파라미터는 600B, 토큰당 활성화 파라미터는 27B, 컨텍스트 윈도우는 100만 토큰이고 텍스트와 비전 입력을 기본 지원한다. 발표 자료는 활용 방향을 구체적으로 제시했는데, AI 코딩, 소프트웨어 엔지니어링, 전문 지식 업무, 금융 분야를 꼽았다.
벤치마크 성적과 자체 벤치마크
Artificial Analysis 종합 지능 지수에서 Step 5 Preview는 44점을 받아 전 세계 오픈웨이트 모델 중 3위에 올랐다. 그 외 공개 벤치마크 성적은 GPQA Diamond 93.5%, Terminal-Bench v2.1 85.0%, BrowseComp 88.7%, 멀티모달 지표인 MMMU-Pro가 76.0%다. StepFun은 AA-LCR, CyberGym 등의 벤치마크에서도 최고 또는 차상위 성적을 기록했다고 밝혔다.
별도로 살펴봐야 할 수치도 있다. StepFun은 StepCodeBench와 FinStepBench라는 두 가지 성적도 함께 공개했는데, 이 두 벤치마크는 자체적으로 구축한 것이다. StepCodeBench는 553개 코드 저장소, 9개 작업 유형, 20개 응용 분야, 33개 프로그래밍 언어를 포괄하며 버그 수정, 기능 개발, 코드 리팩터링, 환경 설정 등 실제 개발 작업을 측정한다. StepFun 스스로도 자체 벤치마크는 공개 리더보드와 설계 의도가 다르며 서로 다른 설정에서 나온 결과는 직접 비교할 수 없다고 자료에 명시했다.
에이전트 능력과 관련해 StepFun은 모델이 3시간이 넘는 연속 작업을 자율적으로 수행할 수 있으며, 코드 디버깅, 시리얼 포트 접근, 스크린샷 캡처, 카메라 호출, 마우스 조작 시뮬레이션을 지원한다고 설명했다. 이러한 설명은 현재 제3자의 재현 검증이 없는 상태이며, 외부에서 확인할 수 있는 것은 공개 벤치마크 수치뿐이다.
비용 주장과 그 이면
이번 발표에서 가장 많이 인용된 문구는 작업 하나당 비용이 Anthropic의 Claude Opus 5의 8분의 1에 불과하다는 것이다. 이 수치의 출처는 StepFun 자신이며, 공개 자료에는 산출 근거—작업 수, 난이도 분포, API 정가 기준인지 실제 사용량 기준인지—가 전혀 명시돼 있지 않다.
이 비율을 구체적인 상황에 대입해 보면, 한 팀이 Opus 5 추론에 매달 10만 위안을 지출한다고 가정할 때 8분의 1로 계산하면 Step 5 Preview는 약 1만 2500위안이 되고, 연간으로는 수백만 위안 규모를 절약하게 된다. 다만 이 수치가 성립하려면 작업 분포가 StepFun이 산정할 때와 동일해야 하는데, 바로 그 부분이 공개되지 않았다. 전환을 고려하는 팀이라면 10월 15일 가중치가 공개된 뒤 직접 동일한 작업을 돌려보는 편이 이 배수를 그대로 인용하는 것보다 신뢰할 만하다.
비교 대상을 고른 방식에서도 포지셔닝이 드러난다. StepFun은 다른 오픈웨이트 모델이 아니라 폐쇄형 최상위 모델군 중에서도 단가가 가장 높은 축을 비교 대상으로 선택했다.
한 달의 시간차
프리뷰 버전을 API로 먼저 공개하고 정식 가중치는 한 달 뒤 내놓는 방식은 올해 중국 기업들 사이에서 점점 더 많이 쓰이는 흐름이다. 먼저 리더보드와 화제성을 선점한 뒤 가중치를 공개하는 것이다. 위험 요소는 이 한 달 사이에 동급 오픈웨이트 플래그십 모델이 언제든 등장할 수 있다는 점으로, 44점이라는 이 순위가 10월 15일까지 유지될지는 아무도 장담할 수 없다.
엔지니어링 관점에서 보면 총 파라미터 600B, 활성화 27B라는 구성은 배포하는 쪽에 비교적 우호적이다. 활성화량이 27B라는 것은 단일 노드의 멀티 GPU로도 추론이 가능하다는 뜻으로, 600B 규모의 밀집 모델처럼 자원을 준비할 필요가 없다는 의미다. 이는 애초에 가중치를 공개할 수 있게 하는 전제 조건이기도 하며, 파라미터 규모가 더 커질수록 오픈소스의 실질적 의미는 배포 문턱에 상당 부분 잠식된다.
라이선스 조항과 API 가격은 이번에 StepFun이 공개하지 않았다. 이 두 가지가 10월 15일 이후 실제로 얼마나 많은 사람이 이 모델을 도입할지를 좌우하게 될 것이다.
참고 출처: StepFun 공식 발표, Ifeng Technology(펑황커지), CocoLoop, Sina Technology(신랑커지). 파라미터 규모, AA 종합 지능 지수 점수, 오픈소스 공개 시점은 공식 발표를 기준으로 확인했으며, 비용 배수와 자체 벤치마크 성적은 모두 StepFun 측이 발표한 수치다.