Arcee AI는 직원이 26명에 불과한 소규모 기업이지만, 업계 많은 사람들을 놀라게 할 성과를 냈다. 벤처캐피털의 약 절반인 2000만 달러를 투입해 2048개의 Nvidia B300 GPU를 33일간 가동, 400억 파라미터의 오픈소스 추론 모델 Trinity-Large-Thinking을 훈련시킨 것이다.
모델의 에이전트 태스크 성능은 상당히 뛰어나다. Tau2-Airline 벤치마크에서 1위(88점), PinchBench에서 2위(91.9점, Anthropic의 Claude Opus 4.6은 93.3점), AIME25 수학 추론에서 96.3점을 기록했다. Apache 2.0 라이선스로 완전 오픈소스화되어 상업적 이용, 다운로드, 수정이 가능하다.
무식한 힘이 아닌, MoE 아키텍처의 극한 활용
Trinity-Large-Thinking은 혼합 전문가 모델(MoE)로, 총 파라미터는 400억이지만 추론마다 활성화되는 것은 약 13억에 불과하다. 256개의 전문가 중 매번 4개만 선택해 활성화한다. 즉, 대규모 모델의 '지식 저장량'을 가지면서도 추론 속도와 리소스 소비는 소규모 모델에 가깝다.
훈련 데이터는 17조 토큰이며, 이 중 8조 이상이 합성 생성 데이터다. 이 비율은 현재 고품질 오픈소스 모델에서 일반적이다.
기술적 하이라이트는 자체 개발한 SMEBU(Soft-clamped Momentum Expert Bias Updates) 알고리즘이다. 대규모 MoE 훈련에서 '전문가 붕괴' 문제를 해결하기 위해 설계됐다. 17조 토큰 전체 훈련 과정에서 '손실 스파이크 제로'를 달성했다. 대규모 모델 훈련에서는 드문 성과로, 많은 MoE 모델이 중간에 갑작스러운 손실 폭발을 경험한다.
강점과 격차
솔직히 말해, Trinity-Large-Thinking은 Claude Opus를 전반적으로 능가하는 것이 아니라 특정 시나리오에서 뛰어난 결과를 보여준다.
| 벤치마크 | Trinity-Large-Thinking | Claude Opus 4.6 |
|---|---|---|
| Tau2-Airline | 88(1위) | 미공개 |
| PinchBench | 91.9(2위) | 93.3 |
| AIME25 | 96.3 | — |
| GPQA-Diamond | 76.3 | 89.2 |
| MMLU-Pro | 83.4 | 89.1 |
에이전트 태스크에서는 최고 수준에 근접하지만, 일반 추론에서는 약 13%포인트의 격차가 있다. 그러나 오픈소스이면서 로컬 배포가 가능한 모델임을 고려하면 이 격차는 이미 상당히 작은 편이다.
또한 동시에 Trinity-Large-TrueBase도 공개됐다. 이는 명령어 미세 조정 전의 순수 사전 훈련 상태를 보존한 '원시 체크포인트' 버전이다. AI 기초 연구에 종사하는 사람들에게 가치가 높으며, RLHF와 명령어 미세 조정이 모델 행동에 미치는 구체적인 영향을 연구할 수 있다.
더 큰 배경: 미국 오픈소스 AI의 긴 공백
지난 1년간 오픈소스 대규모 모델 리더보드는 중국 기업들이 장악해왔다. DeepSeek, Qwen, Kimi, GLM — 몇 달마다 새로운 모델이 등장했다. 미국 쪽에서는 Llama가 유일한 경쟁자였지만, Meta는 최근 일부 신모델을 클로즈드소스화해 오픈소스 커뮤니티의 비판을 받고 있다. Arcee가 이 공백을 메우고 있다.
CEO Mark McQuade는 이 모델의 타겟 사용자는 기업이라고 말한다. 로컬 배포, 커스터마이징이 가능하며 데이터를 클라우드 서비스 제공업체에 보낼 필요가 없다. 데이터 규정 준수 요구사항이 있는 금융, 의료, 정부 기관에게 '자체 서버에서 실행 가능'이라는 특성은 벤치마크 점수보다 더 실용적인 경우가 있다.
26명, 2000만 달러, 33일, 400억 파라미터.
작은 기업이 큰 일을 해내는 것 — 그 정신은 AI 업계에서 아직 살아있다.
출처: Arcee AI spent half its venture capital to build an open reasoning model that rivals Claude Opus in agent tasks (The Decoder); Tiny startup Arcee AI built a 400B-parameter open source LLM from scratch to best Meta's Llama (TechCrunch); CocoLoop, Arcee aims to reboot U.S. open source AI with new Trinity models released under Apache 2.0 (VentureBeat)