리플렉션AI가 첫 오픈 웨이트 모델 Beam을 공개했다. 총 파라미터 5010억 개, 토큰당 230억 개가 활성화되는 스파스 혼합전문가(MoE) 모델로, 코딩·추론·에이전트 작업에 주력한다. 회사 측은 가중치와 기술 보고서, 모델 카드를 이달 말 Apache 2.0 라이선스로 공개할 예정이라고 밝혔다. 모델은 현재 마지막 레드티밍과 평가 단계에 있으며, 개발자는 platform.reflection.ai에서 조기 액세스를 신청할 수 있다.
리플렉션은 전 딥마인드 연구원들이 창업해 1년 넘게 스텔스 모드로 개발을 이어왔다. 올해 6월에는 스페이스X와 총 약 63억 달러(월 약 1억 5000만 달러) 규모의 컴퓨팅 계약을 맺었다.
어떻게 학습시켰나
공식 블로그에 따르면 Beam은 52개 레이어로 구성되며, 중간 학습 단계에서 컨텍스트 윈도를 100만 토큰까지 확장했다. 사전 학습에는 공개 웹 데이터와 라이선스 데이터셋에서 모은 23조 8000억 토큰을 사용했으며, 원본 웹 토큰은 단계별 필터링을 거쳐 약 95%가 걸러졌다.
컴퓨팅 측면에서는 사전 학습이 엔비디아 GB300 6144장으로 4주 미만 진행됐고, 이어진 강화학습 단계에서는 GB300 1만 500장으로 늘려 다시 4주간 진행, 1억 건 이상의 롤아웃을 생성하고 약 13억 개의 샌드박스 환경을 동원했다. 리플렉션은 이번 강화학습 규모에 상당한 자신감을 보인다.
We believe this is one of the largest scale RL runs conducted by any open lab to date.
즉, 지금까지 오픈랩이 수행한 것 중 가장 큰 규모의 강화학습 중 하나라는 의미다. 블로그는 또 강화학습 연산량을 늘릴수록 각 역량이 꾸준히 올라갔으며 “정체기가 보이지 않는다”고 언급했다.
중국 오픈소스 모델과 나란히 보면
리플렉션이 비교 대상으로 삼은 건 거의 전부 중국 모델로, 이 점에서는 꽤 직설적이다. 자체 비교표에서 Beam은 지푸(Zhipu)의 GLM 5.2와 팽팽하게 맞서는 동시에 추론 연산량은 상대의 3분의 1에서 4분의 1 수준만 쓴다고 주장한다. 코딩과 에이전트 작업에서는 파라미터가 2조 개를 넘는 Qwen 3.8-Max에 근접한다고 밝혔다.
몇 가지 수치를 꼽아보면:
| 벤치마크 | Beam | 표 내 비교 |
|---|---|---|
| SWE-bench Verified | 80.9 | Inkling 77.6 |
| Terminal Bench v2.1 | 80.1 | DeepSeek V4.1 Flash 90.6 |
| SWE Bench Pro v2-Hard | 77.2 | Kimi K3 88.2 |
| BrowseComp(컨텍스트 포함) | 77.4 | Kimi K3 91.2 |
| GPQA Diamond | 90.5 | Kimi K3 93.5 |
이 표에서 Beam이 앞서는 항목은 많지 않다. 터미널 조작, 고난도 소프트웨어 엔지니어링, 웹 검색에서는 Kimi K3와 DeepSeek V4.1 Flash가 모두 10포인트 안팎 앞선다. 리플렉션이 내세우는 강점은 효율성이다. 활성 파라미터 230억 개는 이 점수대에서 작은 편이라 배포 비용을 크게 낮출 수 있다는 것이다.
해외 매체들의 논조는 “미국 스타트업이 처음으로 중국 최상위 오픈 모델과 정면으로 맞설 수 있는 모델을 만들었다”는 것이다. 지난 1년여간 오픈 웨이트 순위 상위권은 DeepSeek, Qwen, Kimi, GLM이 차지해 왔고, 미국 쪽에서는 메타가 비공개 Muse 계열로 무게를 옮기면서 내세울 만한 대형 오픈 모델이 드물었다. Beam은 그 공백을 메우는 위치에 있다.
아직 답이 나오지 않은 것들
위의 모든 점수는 리플렉션 자체 평가에서 나온 것으로, 테스트 설정과 샘플링 횟수 같은 세부 사항은 기술 보고서를 기다려야 한다. 가중치가 아직 공개되지 않아 커뮤니티가 독자적으로 벤치마크를 돌려볼 수는 없다.
블로그는 API 가격 정책을 전혀 제시하지 않았고, 어떤 추론 플랫폼에서 먼저 제공될지도 밝히지 않은 채 “생태계 배포 파트너”와 협력한다고만 언급했다. 중국 개발자 입장에서 Apache 2.0 라이선스는 가중치가 공개된 뒤 자유롭게 상업적으로 활용하고 미세조정할 수 있다는 의미지만, 5010억 파라미터 전체 가중치는 VRAM 요구량이 상당해 대부분의 팀은 양자화 버전이나 서드파티 호스팅을 기다릴 가능성이 크다.
참고 출처: 리플렉션AI 공식 블로그, Latent Space, CocoLoop, SiliconANGLE. 파라미터 규모, 학습 연산량, 각 벤치마크 점수는 모두 리플렉션 공식 블로그가 공개한 데이터를 기준으로 한다.