Qwen3.8-Max가 예고 단계를 지나 실제 모델 저장소로 이동했다. 8월 12일 ModelScope의 Qwen/Qwen3.8-2.4T-A95B 페이지는 후학습 모델 가중치와 구성 파일을 Hugging Face Transformers 형식으로 제공한다고 밝혔다.
모델 카드는 vLLM, SGLang, TokenSpeed 호환성을 명시하고, ModelScope 메타데이터는 저장소 크기를 약 4.89TB로 표시한다. Qwen3.8-Max는 이미 Qoder와 Token Plan에서 미리 제공됐지만, 이번에는 Max급 모델이 오픈 가중치 형태로 공개된 것이 핵심이다.
가중치 공개가 검증의 출발점
“This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.”
주요 사양은 총 2.4T 파라미터, 토큰당 95B 활성 파라미터, 기본 262,144토큰 컨텍스트, 최대 1,010,000토큰 확장이다. 구조는 92개 층, 512개 전문가, 10개 routed experts와 1개 shared expert, 248,320개 패딩 어휘로 설명된다.
ModelScope 가중치 모델은 텍스트 전용이며 thinking mode가 필수다. 반면 Qwen Cloud의 Qwen3.8-Max 서비스는 시각 입력, 비사고 모드, 기본 1M 컨텍스트, 내장 도구 등 제품 기능을 더 제공한다.
중요한 것은 통제권
개발팀에게 API 할인과 오픈 가중치는 다르다. 할인은 끝날 수 있지만, 가중치가 있으면 추론 엔진, 양자화, 사내 코드베이스, 장문 문서, 권한 격리를 자체 환경에서 테스트할 수 있다.
물론 4.89TB 크기는 개인용 로컬 모델이 아니라는 점도 보여준다. 대부분의 사용자는 호스팅 추론, 양자화 빌드, 기업 클러스터를 통해 접근할 가능성이 크다. 공개의 가치는 외부 재현과 엔진 최적화를 가능하게 하는 데 있다.
공식 표는 Terminal Bench 2.1 86.6, SWE-bench Pro 67.7, PaperBench 93.0, OSWorld-Verified 86.1을 제시한다. 다만 harness, 제한 시간, 컨텍스트 길이, 기준 모델 출처가 시험마다 다르다. 다음 검증점은 라이선스, 다운로드 안정성, vLLM과 SGLang recipe, 제3자 벤치마크, 양자화 후 성능 보존이다.
출처: ModelScope Qwen3.8-2.4T-A95B 모델 카드, Qwen3.8-Max 공식 블로그, Qwen Cloud 모델 설명, DataCamp, CocoLoop; 오픈 가중치 상태, 저장소 크기, 총/활성 파라미터, 컨텍스트 길이, 프레임워크 호환성, thinking mode 제한, 벤치마크 수치, 관리형 API 차이를 확인했다.