파이어웍스, Kimi K3 개량해 토큰 40% 절감한 Ember-1 공개

추론 서비스 기업 파이어웍스AI(Fireworks AI)가 문샷AI(Moonshot AI)의 오픈 웨이트 모델 Kimi K3를 기반으로 한 Ember-1을 공개했다. 파이어웍스는 모델 구조 자체는 건드리지 않고 사후 학습(post-training)만 진행했으며, 목표는 단 하나였다. K3가 덜 생각하면서도 같은 수준의 답을 내놓게 하는 것이다. 회사 측은 품질 저하를 거의 없이 생성 토큰을 약 40% 줄였다고 밝혔다.

Ember-1은 현재 파이어웍스 서버리스(Fireworks Serverless)에서 리서치 프리뷰 형태로 제공되며, API 호출로만 이용할 수 있다. 가중치와 학습 코드는 공개되지 않아 자체 호스팅은 불가능하다. 가격은 파이어웍스의 K3와 동일하게 입력 100만 토큰당 3달러, 캐시 입력 0.30달러, 출력 15달러로 책정됐다.

줄어든 것은 주로 '생각'하는 과정

파이어웍스는 블로그에서 개발 배경을 설명했다. 사용자들은 K3의 코딩 능력을 좋아하지만, 추론 체인이 너무 길어 코딩 자동화 파이프라인에 넣으면 비용이 잘 줄지 않는다는 문제가 있었다는 것이다. 회사 통계에 따르면 K3 같은 추론 모델은 답을 내놓기 전 내부 추론에만 출력의 90% 이상을 쓰는 경우가 있고, 에이전트가 단계별로 도구를 호출할 때마다 이전에 생각했던 내용을 매번 처음부터 다시 생각하는 문제도 있었다.

가장 직접적인 해법은 K3의 추론 강도(reasoning effort) 단계를 낮추는 것이지만, 파이어웍스는 낮은 단계에서는 품질 저하가 너무 컸다고 밝혔다. Ember-1은 다른 길을 택했다. 회사는 다음과 같이 설명했다.

"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."

학습은 수학, 코딩, 지시 이행, 대화, 검색, 도구 호출, 소프트웨어 엔지니어링을 대상으로 진행됐으며, 50회 이상의 학습 실험과 200회 이상의 평가를 모두 자사의 서버리스 트레이닝(Serverless Training) 인프라에서 자체 데이터로 수행했다. 파이어웍스는 구체적인 알고리즘은 새로운 방식이며 아직 발표되지 않아 외부에서 재현할 수 없다고 밝혔다.

벤치마크는 오른 곳도, 내린 곳도 있다

파이어웍스는 Ember-1과 K3의 세 단계를 비교했다.

벤치마크K3 LowK3 HighK3 MaxEmber-1
Terminal Bench 2.176.4%77.6%80.9%82.0%
SWE-bench Verified80.4%86.0%93.2%92.2%
DeepSWE 1.155.8%62.8%66.4%75.2%

DeepSWE에서는 K3 Max를 약 9%포인트 앞섰지만, SWE-bench Verified에서는 약 1%포인트 뒤졌다. 제3자 매체가 인용한 자료에 따르면 SWE-Interact에서도 Ember-1은 K3 Max보다 소폭 낮았다. 이 수치들은 모두 파이어웍스 자체 테스트 결과이며, 아직 독립적인 평가 기관의 검증은 이뤄지지 않았다.

더 설득력 있는 것은 실제 운영 데이터다. 파이어웍스는 고객사 2곳과 실제 코딩 트래픽으로 A/B 테스트를 진행했고, 작업당 토큰 수가 전체적으로 약 35% 줄었다는 결과를 얻었다. 가장 상세한 데이터셋에서는 추론 토큰이 71.3%, 총 토큰이 39% 줄었고, 작업 점수는 0.753 대 0.751이었다. 한 고객사는 이미 Ember-1을 운영 환경에 적용했으며, 회사명은 공개되지 않았다.

대략적인 비용 계산

단가가 동일하기 때문에 비용 절감은 오로지 생성량 감소에서 나온다. 위 A/B 데이터를 기준으로 계산하면 K3 Max의 작업당 출력 비용은 약 0.74달러, Ember-1은 약 0.45달러다. 하루 1만 건의 코딩 작업을 처리하는 팀이라면 일일 출력 비용이 약 7400달러에서 4500달러 안팎으로 줄어들고, 월 단위로는 8만 달러 이상 차이가 나는 셈이다. 이 계산은 출력 토큰만 반영한 것으로 입력과 캐시는 포함하지 않았으며, 실제 절감 폭은 작업 길이에 따라 달라진다.

중국 개발자들에게 Ember-1의 의미는 오히려 방법론 쪽에 가깝다. K3는 오픈 웨이트 모델이라 누구나 사후 학습을 할 수 있으며, 파이어웍스는 '추론 길이 압축' 자체를 독립적인 상품으로 팔 수 있다는 것을 보여준 셈이다. 중국 내 추론 서비스 기업들도 K3, 딥시크(DeepSeek), Qwen 같은 오픈 모델을 보유하고 있어, 비슷한 '토큰 절약판'이 등장할지 지켜볼 만하다. Ember-1 자체를 중국 내에서 사용하려면 해외 API를 거쳐야 해서, 지연 시간과 컴플라이언스는 이용자가 직접 검토해야 한다.

참고 출처: 파이어웍스AI 공식 블로그, MarkTechPost, CocoLoop, 파이어웍스 모델 페이지. 세 가지 벤치마크 점수, A/B 테스트의 토큰·점수 데이터, 입출력 100만 토큰당 가격을 대조 확인했다.