Qwen3.8-Flash-Next 오늘밤 오픈소스, Qwen4 아키텍처 조기 적용

모다스코프(魔搭社区)에 Qwen3.8-Flash-Next 예고 페이지가 올라왔다. 카운트다운은 8월 26일 23시(UTC+8)를 가리키고 있으며, 표준판과 FP8판이 동시에 공개될 예정이다. 허깅페이스에 올라온 동명 저장소 설명은 단 한 줄, "A Preview of the Qwen4 Architecture"뿐이다.

예고 페이지에서 유출된 파라미터 구성은 주 파라미터 1250억(125B), 별도의 N-gram 임베딩 510억(51B), 토큰당 활성화 파라미터 60억(6B)이다. 모델은 멀티모달 MoE로 포지셔닝되어 있으며, 공식 설명에 따르면 차세대 Qwen4 아키텍처를 기반으로 하고 있고, 아키텍처 진전을 미리 오픈소스로 공개해 커뮤니티가 Qwen4 시리즈를 맞이할 준비를 하도록 한다는 취지다.

활성화율 5% 미만으로 압축

1250억 개 중 활성화되는 것은 60억 개뿐, 활성화율은 대략 계산해도 5%를 밑돈다. 참고로 최근 몇 년간 업계에서 흔히 보이는 희소 MoE는 대체로 5%에서 10% 구간에 머물러 있는데, Flash-Next는 희소도를 한 단계 더 낮췄다.

이는 명확하게 추론 비용을 겨냥한 구성이다. MoE의 메모리 사용량은 총 파라미터 수로 결정되고, 연산량은 활성화 파라미터 수로 결정된다. 1250억 개의 가중치는 VRAM에 올라가야 하지만, 한 번의 순전파에서 실제로 거치는 경로는 60억 개뿐이다. 배포 측면에서 보면 GPU 용량 문턱은 낮아지지 않지만, 연산량과 지연 시간의 문턱은 크게 낮아진다. FP8판과 결합하면 가중치 점유량을 다시 절반 가까이 줄일 수 있다. 이름에 붙은 'Flash'는 아마 이 지점을 가리키는 것으로 보인다.

파라미터 표에서 눈에 띄는 것은 주 파라미터에서 따로 분리해 표기한 510억 개의 N-gram 임베딩이다. 임베딩류 구조는 보통 조회(lookup) 위주로 동작하며 레이어별 행렬 연산에는 참여하지 않는다. Flash-Next도 같은 방식을 따른다면, 이 510억은 연산 비용이라기보다는 VRAM을 들여 성능을 사는 투자에 가깝다고 볼 수 있다. 다만 실제 구현 방식은 오늘 밤 공개될 모델 카드와 설정 파일을 봐야 확인할 수 있다.

왜 '3.8'인데 Qwen4 아키텍처인가

이름은 어색해 보이지만 논리는 일관적이다. Qwen이 3.x 시리즈 말미에 Next 프리뷰 버전을 내놓은 것은 이번이 처음이 아니며, 방식은 동일하다. 차세대 라우팅 방식, 어텐션 변형, 학습 스택을 중간 규모 모델로 먼저 검증하고 오픈소스로 공개해 커뮤니티가 툴체인을 먼저 맞춰볼 수 있게 한 뒤, 정식 메이저 버전을 내놓는 식이다.

이점은 실질적이다. 오픈소스 모델이 공개 당일 vLLM, SGLang, llama.cpp 같은 프레임워크에 바로 적용되느냐는 이후 2주간의 채택 곡선을 크게 좌우한다. 아키텍처에 새로운 연산자나 새로운 라우팅 방식이 들어가면 적용까지 수 주가 걸리는 경우가 많다. Unsloth는 이미 데이 제로(day-zero) 지원을 준비 중이라고 발표했는데, 바로 이 경로를 따르는 것이다. 아키텍처 적용에 드는 시간 비용을 Qwen4 발표일에서 오늘로 앞당긴 셈이다.

허깅페이스의 해당 저장소는 공개 전인데도 이미 1299명이 알림 신청 버튼을 눌렀다. 모델 카드조차 없는 빈 저장소치고는 낮지 않은 수치다.

오늘 밤 이후 무엇을 봐야 하나

예고 페이지가 공개한 정보는 파라미터 수까지다. 컨텍스트 길이, 멀티모달이 어떤 모달리티까지 커버하는지, 라이선스가 Apache 2.0을 유지하는지, 그리고 가장 중요한 벤치마크 성적까지 핵심 지표는 하나도 공개되지 않았다.

알리바바는 지난 1년간 오픈소스 전략에서 가중치를 생태계 진입점으로 삼아왔고, Max급 모델의 가중치까지 공개한 바 있다. Flash-Next는 이 타임라인을 한 걸음 더 앞당긴 사례다. 모델이 완성되기 전에 아키텍처부터 먼저 내놓은 것이다. 중국 내에서 추론 배포와 파인튜닝을 다루는 팀들에게는 오늘 밤 23시 이후 48시간이 꽤 바쁠 전망이다.

참고 출처: 모다스코프 모델 페이지, 허깅페이스 저장소, CocoLoop, Decrypt, 해커뉴스 커뮤니티 토론; 파라미터 구성과 공개 시각은 모델 페이지에 표시된 정보를 기준으로 하며, 활성화율은 공개된 파라미터를 바탕으로 한 대략적 추산치다.