Qwen3.6-27B 오픈소스 공개, 397B MoE 제치다

먼저 이 숫자를 보겠습니다: SWE-bench Pro 53.5 vs 50.9.

전자는 Qwen3.6-27B로, 270억 개 파라미터 모델이며 4월 22일 Apache 2.0 라이선스로 오픈소스 공개되었습니다. 후자는 Qwen3.5-397B로, 3970억 개 파라미터의 Mixture-of-Experts(MoE) 모델이자 알리바바의 기존 주력 모델입니다.

270억 파라미터의 소형 모델이 약 400억 활성화 파라미터의 대형 모델을 소프트웨어 엔지니어링 벤치마크에서 이긴 것은 결코 작은 일이 아닙니다.

Thinking Preservation: 이것이 핵심이다

솔직히 말해, 적은 파라미터로 더 강력한 성능을 내는 이야기는 이 분야에서 여러 번 있어왔습니다. Qwen3.6-27B가 이러한 성과를 낼 수 있었던 핵심은 아키텍처 자체가 아니라 새로운 기능인 Thinking Preservation(사고 보존)에 있습니다.

오픈소스 LLM에는 간과된 문제가 있습니다. 에이전트가 멀티턴 작업을 실행할 때 각 턴의 추론 과정이 폐기된다는 점입니다. 모델은 매번 컨텍스트에서 다시 추론해야 하며, 이전에 구축된 인지 체인을 재사용할 수 없습니다.

Qwen3.6-27B의 접근 방식은 기록 메시지의 "사고 궤적"을 지속적인 컨텍스트로 유지하는 것입니다:

"이전 추론을 폐기하는 대신 대화 전체에 걸쳐 기록 메시지의 사고 궤적을 유지하고 활용하여 멀티턴 에이전트 워크플로의 효율성을 향상시킵니다"

쉽게 말해, 모델이 이전에 어떻게 생각했는지를 기억하고 매번 초기화되지 않는다는 뜻입니다.

에이전틱 코딩 작업에서 이 차이는 뚜렷합니다. 동일한 코드 저장소를 처리할 때, 이전 추론 결론을 기억하는 모델과 그렇지 않은 모델 간의 성능 차이는 큽니다. SWE-bench Pro는 실제 코드베이스 작업을 실행하는 테스트이므로, 이 장점은 더욱 확대됩니다.

벤치마크 개요

SWE-bench뿐만 아니라 Qwen3.6-27B의 성능은 전반적으로 우수합니다:

벤치마크Qwen3.6-27B비교
SWE-bench Pro53.5vs Qwen3.5-397B MoE: 50.9
Terminal-Bench 2.059.3Claude Opus 플래그십과 동등
AIME26 (수학 경시)94.1vs Qwen3.5-27B: 92.6
QwenWebBench1487vs Qwen3.5-27B: 1068 (+39%)
SkillsBench 평균48.2이전 세대 동일 크기 모델 대비 77% 향상
GPQA Diamond87.8vs Qwen3.5-27B: 85.5

SkillsBench의 77% 향상은 특별히 언급할 가치가 있습니다. 이 벤치마크는 교차 도메인 일반 능력을 측정합니다. Qwen3.5-27B에서 Qwen3.6-27B로의 도약은 사소한 개선이 아니라 시스템 수준의 재구축입니다.

컨텍스트 윈도우

네이티브로 262,144 토큰(약 20만 중국어 문자)을 지원하며, YaRN을 사용하여 1,010,000 토큰까지 확장 가능합니다.

긴 코드 저장소나 긴 문서를 처리해야 하는 시나리오에서 이 컨텍스트는 충분합니다.

오픈소스의 의미

Apache 2.0 라이선스로 상업적 사용에 제한이 없습니다.

이는 기업에게 성능 수치 자체보다 더 실용적입니다. 270억 파라미터 모델은 3970억 파라미터 모델보다 로컬 배포 비용이 훨씬 낮으면서도 핵심 작업에서 더 높은 점수를 기록합니다. 이 조합은 자체 AI 역량을 구축하려는 기업에게 매우 매력적입니다. 소비자용 GPU 한 장으로 27B 모델을 실행할 수 있는 반면, 397B 모델은 최소한 여러 대의 고성능 머신이 필요합니다.

이것이 SkillsBench의 77%라는 수치가 중요한 이유이기도 합니다. 코드뿐만 아니라 일반 능력이 전반적으로 향상되었다는 것이 대형 모델을 진정으로 대체할 수 있는 전제 조건이기 때문입니다.

이번 주 구도

이번 주에는 공교롭게도 OpenAI가 GPT-5.5를, 알리바바가 Qwen3.6-27B를 출시했습니다.

두 가지를 함께 보면, 폐쇄형 소스 플래그십은 "더 빠르고 더 토큰 효율적인" 방향을, 오픈소스 소형 모델은 "더 적은 파라미터로 더 나은 결과"를 추구하고 있습니다. 방향은 다르지만, 서로의 영역을 압박하고 있습니다.

다음에 무너질 것은 특정 기업이 아니라 "좋은 코드를 실행하려면 대형 모델이 필요하다"는 가정 자체일 수도 있습니다.

출처: CocoLoop, Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks (MarkTechPost)