알리바바 통이치엔원(Tongyi Qianwen) 팀이 플래그십 모델 Qwen3.8-Max를 0902 버전으로 업데이트하며 코딩과 전문 업무 작업을 중심으로 추가 후속 학습을 진행했다. Code Arena의 프런트엔드 코딩 종합 랭킹에서 이번 버전은 1691점을 받아 1위에 올랐고, 이전 버전보다 22점 높았다.
알리바바가 함께 공개한 또 다른 수치는 이 모델이 노리는 위치를 더 잘 보여준다. 신규 버전의 100만 토큰당 종합 평균 가격은 약 5달러인 반면, 랭킹에서 뒤이은 2위와 3위 모델은 각각 20달러, 12달러다.
22점과 15달러
랭킹 상위권의 점수 차는 이미 크지 않다. 1691점과 이전 버전 사이 22점 차이는 사람이 직접 블라인드로 평가하는 방식에서 보통 1~2주 안에 경쟁사가 따라잡는 수준의 격차다. 실제로 격차를 벌리는 건 오른쪽 항목이다. 같은 프런트엔드 작업을 2위 모델로 처리하면 청구액이 4배로 뛴다.
공개된 보도에 따르면 신규 버전의 API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러다. 이 두 수치를 공식 발표한 종합 평균 가격 5달러에 대입해 역산해 보면(대략적인 계산), 출력 토큰이 전체 사용량의 약 4분의 3을 차지해야 5달러라는 값이 나온다. 이 비율은 프런트엔드 코딩류 작업에서는 이상할 게 없다. 프롬프트는 대개 수백 줄짜리 컨텍스트에 그치지만, 모델이 뱉어내는 건 페이지 전체 분량의 컴포넌트 코드이기 때문에 출력 쪽이 사용량 대부분을 차지하는 게 자연스럽다. 5달러라는 평균가는 '코드를 작성'하는 실제 사용 패턴을 기준으로 산출된 값이며, 긴 문서 요약처럼 입력이 무겁고 출력이 가벼운 작업으로 바꾸면 실질 단가는 더 낮아진다.
중국 내 팀들에게 이 가격선은 뚜렷한 기준점이 된다. 지난 1년간 에이전트 기반 코딩을 실제 운영에 도입한 기업들이 막히는 지점은 대부분 재무 단계였다. 모델이 코드를 제대로 작성하는지는 더 이상 문제가 아니고, 하루 수백만 토큰에 달하는 호출량을 쌓았을 때 그 청구서에 결재가 나느냐가 관건이다. 상위권과 점수는 비슷하게 맞추면서 가격은 4분의 1로 깎는 조합은 단순히 22점을 더 얻는 것보다 구매 결정을 훨씬 크게 움직인다.
2조 4000억 매개변수, 실제로 움직이는 건 950억
0902 버전의 기반이 되는 건 Qwen3.8-2.4T-A95B라는 베이스 모델이다. 총 매개변수는 2조 4000억 개이며, 한 번의 순전파(forward)에서 실제로 활성화되는 건 약 950억 개다. 전형적인 희소 MoE(전문가 혼합) 구조로, 512개의 전문가 중 토큰당 11개가 활성화되고 이 중 10개는 라우팅되는 전문가, 1개는 공유 전문가다.
구조적인 선택 역시 장시간 작업에 유리한 쪽으로 이뤄졌다. 모델은 23개 레이어로 구성되며 Gated DeltaNet과 Gated Attention이 교대로 배치돼 있다. 네이티브 컨텍스트 길이는 26만 2144토큰이고, 약 101만 토큰까지 확장할 수 있다. 선형 어텐션과 게이트형 어텐션을 함께 쓰는 방식은 지난 반년 동안 중국 내 여러 대형 컨텍스트 개발팀이 택해 온 방향과 같다. 목적은 분명하다. 긴 컨텍스트에 드는 메모리와 추론 비용을 상용화 가능한 수준까지 압축하는 것이다. 그렇지 않으면 100만 토큰 컨텍스트는 스펙표에나 그럴듯하게 적히는 숫자에 그친다.
활성화 비율은 그 5달러라는 숫자가 어디서 나왔는지도 설명해 준다. 2조 4000억이라는 총 매개변수는 모델의 지식 용량을 결정하고, 950억이라는 활성화 매개변수는 호출 한 번에 드는 '전기요금'을 결정한다. 희소도를 이 정도까지 끌어올리면 동급 규모의 밀집(dense) 모델보다 추론 단가가 자연히 크게 낮아진다.
API는 이미 자사 전 제품군에 깔렸다
신규 버전은 이제 통이치엔원 AI 플랫폼의 API 서비스에서 바로 호출할 수 있고, 통이치엔원 오피스, Qoder, 통이치엔원 앱에도 동시에 탑재됐다. 기업 고객, 개발자, 일반 사용자라는 세 경로가 한꺼번에 열렸고 별도의 단계적 공개 기간은 두지 않았다.
알리바바는 이번 버전을 '기업의 실제 복잡한 업무, 연구, 장기 과제 등에 더 적합하다'고 자리매김했으며, 다단계 추론과 툴 호출, 엔드투엔드 앱 생성 분야에서 '전 세계 모델의 새로운 상한선을 갱신했다'고 밝혔다. 뒷부분은 제조사 측 표현이지만, 앞부분의 '장기 과제'라는 대목은 약 101만 토큰 컨텍스트와 희소 활성화라는 두 가지 기술적 선택과 맞아떨어진다. 코드베이스 전체를 한 번에 담으면서도 비용이 터지지 않아야, 모델이 몇 시간씩 끊김 없이 작업한다는 이야기가 성립한다.
네이밍 방식에도 속도가 드러난다. Qwen3.8-Max가 날짜를 서브 버전 번호로 쓴다는 건, 알리바바가 폐쇄형 Max 라인에서 잘게 쪼개 빠르게 반복하는 전략을 취하고 있다는 뜻이다. 모델 세대는 그대로 두고 성능만 계속 쌓아 올리는 방식이다. 3.6-Max가 폐쇄형으로 전환된 이후 Max 시리즈는 오픈소스인 Flash 시리즈와 역할을 나눠 왔다. 하나는 랭킹 상위권과 기업 예산을 차지하고, 다른 하나는 개발자 생태계를 넓힌다. 이번 0902 버전이 가격을 랭킹 상위권의 4분의 1까지 낮추면서, 이 역할 분담은 한 단계 더 뚜렷해졌다.
참고 출처: 알리바바 통이치엔원 공식 발표, CocoLoop, Code Arena 프런트엔드 코딩 랭킹 페이지, ITHome, Hugging Face 모델 카드. 1691점과 22점 상승폭, 100만 토큰당 5·20·12달러의 종합 평균 가격, 총 매개변수 2조 4000억 개와 활성화 매개변수 950억 개 수치는 각각 개별적으로 확인했다.