4월 16일, 알리바바 Qwen 팀이 Qwen3.6-35B-A3B를 Apache 2.0 라이선스로 오픈소스화했다. 상업적 사용에 제한이 없다.
이 모델의 특징은 총 350억 개의 파라미터를 가지면서도 추론 시에는 30억 개만 활성화한다는 점이다. 혼합 전문가(MoE) 아키텍처를 채택했으며, 계산 희소 비율은 12:1이다. 350억 파라미터 고밀도 모델에 가까운 성능을 30억 파라미터 모델 수준의 실행 비용으로 제공한다.
SWE-bench Verified(실제 GitHub 이슈 수정 테스트)에서 73.4%를 기록했다. 비교 대상인 구글의 오픈소스 Gemma 4-31B는 52.0%로, 21%포인트 차이가 났다.
아키텍처가 중요한 이유
먼저 MoE의 설계 논리를 설명한다.
일반적인 고밀도 모델은 각 토큰을 처리할 때 모든 파라미터가 연산에 참여한다. 350억 파라미터 모델은 토큰당 350억 규모의 연산이 필요하다.
MoE는 다르다. 파라미터를 여러 '전문가(expert)'로 나누고, 토큰당 그중 일부만 활성화한다. Qwen3.6-35B-A3B의 라우팅 메커니즘은 각 토큰 처리에 30억 파라미터에 해당하는 전문가 그룹만 호출하지만, 모델 전체는 350억 파라미터의 지식 용량을 유지한다.
결과는 추론 속도와 메모리 사용량은 30억 파라미터 모델 수준이면서 문제 해결 능력은 350억 파라미터 모델 수준이라는 것이다.
RTX 4090에서 초당 120토큰 이상의 속도로 실행된다. 64GB MacBook Pro M4/M5에서도 직접 실행할 수 있다. Q4_K_M 양자화 후 약 21GB로, 일반 소비자용 GPU 한 장으로 구동 가능하다.
이는 로컬 배포에 큰 의미를 가진다. 이전에는 최첨단 오픈소스 코딩 모델을 실행하려면 최소 A100 또는 여러 장의 RTX 4090이 필요했다. 이제 소비자용 GPU 한 장으로 충분하다.
다른 모델과의 비교
Google Gemma 4-31B 대비:
| 벤치마크 | Qwen3.6-35B | Gemma 4-31B |
|---|---|---|
| SWE-bench Verified | 73.4% | 52.0% |
| Terminal-Bench 2.0 | 51.5% | 42.9% |
| MCPMark(도구 호출) | 37.0% | 18.1% |
| GPQA(일반 추론) | 86.0% | 84.3% |
| AIME26(수학 경시) | 92.7% | 89.2% |
도구 호출(MCPMark)에서 Qwen3.6은 Gemma 4의 두 배 이상 점수를 기록했다. 이 벤치마크는 실제 에이전트 작업 성능에 직접 대응하므로 SWE-bench보다 실제 사용에 더 가깝다.
QwenWebBench(웹 작업)에서는 1397 ELO를 기록해 이전 세대보다 43% 향상되었다.
Claude Sonnet 4.5 대비:
The Decoder의 평가에 따르면, 순수 코딩 벤치마크에서는 두 모델이 거의 비슷하며 차이는 측정 오차 범위 내에 있다. 어시스턴트 스타일 대화와 일반 잡담에서는 Claude가 여전히 앞서고 있다.
오픈소스 세부 사항 및 사용 가능성
모델 가중치는 Hugging Face(Qwen/Qwen3.6-35B-A3B)와 ModelScope에서 다운로드할 수 있으며, Transformers, vLLM(>=0.19.0), SGLang(>=0.5.10), KTransformers와 호환된다.
두 가지 모드를 지원한다:
- Thinking 모드: 추론 모델과 유사하게 다단계 심층 사고를 수행하며, 추론 과정을 보존해 후속 대화에 활용할 수 있다.
- Fast 모드: 직접 출력하며, 대화 및 경량 작업에 적합하다.
기본 컨텍스트 윈도우는 262,144토큰이며, YaRN 확장을 통해 100만 토큰 이상으로 확장 가능하다.
API는 Alibaba Cloud Model Studio(명칭 "Qwen3.6 Flash")를 통해서도 호출할 수 있으며, 직접 배포할 수도 있다.
이번 발표의 의미
이는 알리바바의 오픈소스 방향성에서 세 번째 단계다. 먼저 Qwen3 기본 버전을 오픈소스화(Apache 라이선스)했고, 다음으로 클로즈드소스 Qwen3.6-Plus 엔터프라이즈 버전을 출시했으며, 이번에 고성능 코딩 특화 버전인 Qwen3.6-35B-A3B를 오픈소스화했다.
각 단계의 리듬은 명확하다. 먼저 커뮤니티와 개발자 기반을 구축하고, 클로즈드소스 버전으로 수익을 창출하며, 오픈소스 버전으로 생태계를 심화한다.
Qwen3.6-35B-A3B의 SWE-bench 73.4% 성적은 전체 오픈소스 모델 중 어떤 수준일까? 현재 오픈소스에서 이름을 올릴 만한 모델은 DeepSeek V4와 이 모델 정도다. 클로즈드소스에서는 Claude Sonnet 4.5도 이 범위에 있다. 로컬에서 실행 가능한 MoE 모델이 이 점수를 달성했다는 것은 확실히 상황을 변화시키고 있다.
물론 SWE-bench 고득점이 곧바로 프로덕션 환경에서의 우수성을 보장하지는 않는다. 코딩 에이전트의 실제 성능은 컨텍스트 관리, 오류 복구, 긴 흐름 안정성에도 달려 있다. 이러한 요소들은 벤치마크에서 측정되지 않는다. 하지만 이 출발점은 진지하게 평가해볼 가치가 있다.
출처: CocoLoop, Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks(The Decoder); Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally(Build Fast with AI); Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model(DEV Community)