4월 22일, Qwen 팀이 Hugging Face에 새로운 모델을 공개했다. 27B 파라미터, Dense 아키텍처, Apache 2.0 라이선스이며 이름은 Qwen3.6-27B다.
공개 블로그 게시물에는 벤치마크 점수가 포함되어 있었다. SWE-bench Verified: 77.2. 비교를 위해 Qwen3.5-397B-A17B의 점수도 함께 실렸다: 76.2.
27B Dense 모델이 자사의 397B MoE 플래그십을 코딩 벤치마크에서 이겼다.
이는 우연이 아니다. 그 뒤에는 구체적인 이유가 있다.
MoE의 누수는 어디서 시작되는가
MoE(Mixture of Experts) 아키텍처는 지난 2년간 대규모 모델 확장의 주류 해법이었다. 논리는 간단하다: 총 파라미터 수는 크지만, 추론마다 소수의 '전문가'만 활성화되므로 실제 계산량은 상대적으로 통제 가능하다.
Qwen3.5-397B는 총 397B 파라미터를 가지며 추론마다 17B를 활성화한다. Qwen3.6-27B는 추론마다 전체 27B를 활성화한다——계산량은 비슷하지만 방식은 근본적으로 다르다.
Dense 아키텍처의 추론은 더 일관되고 예측 가능하다. MoE는 라우팅에 일정한 무작위성을 가진다: 다른 입력이 다른 전문가 조합을 촉발할 수 있으며, 이는 긴 연쇄 작업에서 편차를 누적시킨다.
코드 생성과 같은 작업에서는 안정성이 매우 중요하다. '평균적으로는 괜찮지만 가끔 표류하는' 것이 아니라 '모든 단계에서 정확한' 것이 필요하다.
Terminal-Bench 2.0에서 27B 모델은 59.3점을 기록했고, 397B 모델은 52.5점에 그쳤다. SkillsBench에서는 격차가 더 컸다: 48.2 대 30.0.
| 모델 | 파라미터 규모 | SWE-bench | Terminal-Bench | SkillsBench |
|---|---|---|---|---|
| Qwen3.6-27B | 27B Dense | 77.2 | 59.3 | 48.2 |
| Qwen3.5-397B-A17B | 397B MoE | 76.2 | 52.5 | 30.0 |
세 가지 테스트 모두에서 27B 모델이 승리했다.
Thinking Preservation이란 무엇인가
Qwen3.6-27B에는 'Thinking Preservation'이라는 메커니즘이 추가되었으며, 이에 대해 별도로 언급할 가치가 있다.
다중 턴 대화에서 모델은 이전 추론 과정의 요약을 유지한다. 다음 턴에서는 처음부터 추론할 필요 없이 이전 사고 결과를 직접 이어받는다.
이는 에이전트 워크플로우에서 매우 유용하다. 10단계 작업을 완료해야 하는 에이전트의 경우, 처음 세 단계의 분석 결과는 네 번째 단계에서 사라져서는 안 되며 컨텍스트로 지속되어야 한다. 이는 반복적인 토큰 생성을 줄이고 긴 작업에서 '망각으로 인한 표류'를 낮춘다.
이 설계는 MoE의 라우팅 메커니즘과 반대 방향으로 움직인다: MoE는 파라미터를 수평적으로 확장하는 반면, Thinking Preservation은 상태 전달을 수직적으로 최적화한다. 두 접근법은 서로 다른 수준의 문제를 해결한다.
소비자용 하드웨어에서 실행 가능
이것이 이 모델의 또 다른 실용적 가치다.
Qwen3.5-397B의 전체 버전은 807GB의 저장 공간이 필요하다. 양자화 버전도 수백 GB가 필요하며, 실행하려면 멀티 GPU 서버를 준비해야 하므로 일반 개발자에게는 사실상 불가능하다.
Qwen3.6-27B:
- 전체 버전: 55.6GB
- 양자화 GGUF 버전: 16.8GB
- RTX 4090 한 장으로 실행 가능, 속도 약 25토큰/초
- M4 Max MacBook에서도 문제없이 작동
기본 컨텍스트 윈도우는 262,144 토큰이며, 100만 토큰까지 확장 가능하다. Apache 2.0 라이선스로 상업적 사용에 제한이 없다.
이로 인해 로컬 배포의 장벽이 크게 낮아졌다. 코드를 클라우드 API로 전송하지 않고 사내 네트워크에 코딩 에이전트를 배포하려는 엔지니어 팀은 이전에는 성능이 낮은 오픈소스 모델이나 고가의 GPU 서버 중에서 선택해야 했다. 이제 하나의 옵션이 생겼다.
이것이 MoE에 의미하는 바
알리바바의 이번 발표 시점은 흥미롭다. Qwen3.6-27B는 플래그십 클로즈드소스 버전인 Qwen3.6-Max가 공개된 지 며칠 후에 뒤따랐다——하나는 최고 수준의 성능을 보여주며 상업 고객을 유치하고, 다른 하나는 개발자 커뮤니티를 위한 것이다. 두 개의 다리로 서로 다른 계층에 서비스를 제공한다.
하지만 더 큰 질문은 이것이다: 27B Dense 모델이 이미 에이전틱 코딩에서 Claude Opus 4.5와 대등한 수준에 도달했다면, 다음 경쟁은 어떤 차원에서 벌어질 것인가?
Terminal-Bench에서 27B 모델은 Claude Opus 4.5와 동점을 기록했으며, Opus 4.5의 API 가격은 백만 토큰당 15달러 이상이다. Qwen3.6-27B는 오픈소스이며 자체 배포가 가능하다.
벤치마크의 점진적 이득은 점점 줄어들고 있다. 사용자들은 지연 시간, 비용, 로컬 배포 가능성을 더 중요하게 여기기 시작했다.
이러한 추세는 오픈소스 모델에 유리하고, 클로즈드소스 API 서비스에는 압박으로 작용한다.
다음 단계는 Kimi, DeepSeek, MiniMax가 어떻게 대응할지 지켜보는 것이다.
참고 출처: CocoLoop, Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model (Simon Willison's Blog); Alibaba's Qwen3.6-27B Beats 397B Model in Coding Tasks (AI Daily Post); Qwen3.6-27B (Hacker News)