4月22日、QwenチームはHugging Faceに新モデルを公開した。パラメータ数は27B、Denseアーキテクチャ、ライセンスはApache 2.0。名称はQwen3.6-27Bである。
公開ブログではベンチマークスコアが掲載された。SWE-bench Verified:77.2。比較としてQwen3.5-397B-A17Bのスコアも併記されている:76.2。
27BのDenseモデルが、自社の397B MoEフラッグシップをコーディングベンチマークで上回った。
これは偶然ではない。背後には具体的な理由がある。
MoEの弱点はどこにあるか
MoE(混合エキスパート)アーキテクチャは、過去2年間の大規模モデル拡張における主流の解法だった。論理は単純だ:総パラメータ数は大きいが、推論ごとに一部の「エキスパート」だけを活性化するため、実際の計算量は比較的制御可能である。
Qwen3.5-397Bは総パラメータ397B、推論ごとに17Bを活性化する。Qwen3.6-27Bは推論ごとに全27Bを活性化する——計算量はほぼ同等だが、その方法は根本的に異なる。
Denseアーキテクチャの推論はより一貫性があり、予測可能である。MoEはルーティングに一定のランダム性を持つ:異なる入力が異なるエキスパートの組み合わせを引き起こす可能性があり、長い連鎖タスクでは偏差が蓄積される。
コード生成のようなタスクでは、安定性が極めて重要である。「平均的には良いが時々ずれる」ではなく、「すべてのステップで正しい」ことが求められる。
Terminal-Bench 2.0では、27Bモデルが59.3を記録したのに対し、397Bモデルは52.5だった。SkillsBenchでは差がさらに大きい:48.2対30.0。
| モデル | パラメータ規模 | SWE-bench | Terminal-Bench | SkillsBench |
|---|---|---|---|---|
| Qwen3.6-27B | 27B Dense | 77.2 | 59.3 | 48.2 |
| Qwen3.5-397B-A17B | 397B MoE | 76.2 | 52.5 | 30.0 |
3つのテストすべてで27Bモデルが勝利した。
Thinking Preservationとは何か
Qwen3.6-27Bには「Thinking Preservation」と呼ばれるメカニズムが追加されており、これについて個別に言及する価値がある。
マルチターン対話において、モデルは以前の推論プロセスの要約を保持する。次のターンではゼロから推論する必要はなく、前回の思考結果を直接引き継ぐ。
これはエージェントワークフローで非常に有用である。10ステップのタスクを完了するエージェントの場合、最初の3ステップの分析結果は4ステップ目で消えるべきではなく、コンテキストとして継続されるべきである。これにより、繰り返しのトークン生成が減少し、長いタスクにおける「忘却によるずれ」が低減される。
この設計はMoEのルーティングメカニズムとは逆の方向性を持つ:MoEはパラメータを水平方向に拡張するのに対し、Thinking Preservationは状態伝達を垂直方向に最適化する。両者は異なるレベルの問題を解決する。
コンシューマーハードウェアで動作可能
これがこのモデルのもう一つの実用的価値である。
Qwen3.5-397Bのフルバージョンには807GBのストレージが必要である。量子化バージョンでも数百GBが必要で、実行にはマルチGPUサーバーが必要となり、一般の開発者にはほぼ手が届かない。
Qwen3.6-27B:
- フルバージョン:55.6GB
- 量子化GGUFバージョン:16.8GB
- RTX 4090一枚で動作し、速度は約25トークン/秒
- M4 Max MacBookでも問題なく動作
デフォルトのコンテキストウィンドウは262,144トークンで、100万トークンまで拡張可能。Apache 2.0ライセンスにより、商用利用に制限はない。
これにより、ローカルデプロイのハードルは大幅に下がった。コードをクラウドAPIに送信せずに社内ネットワークにコーディングエージェントをデプロイしたいエンジニアチームは、これまでは性能の低いオープンモデルか高価なGPUサーバーを選ぶ必要があった。今、一つの選択肢が登場した。
これがMoEにとって意味すること
Alibabaの今回のリリースのタイミングは興味深い。Qwen3.6-27Bは、フラッグシップのクローズドソース版であるQwen3.6-Maxの公開から数日後に続いた——一方はトップラインの能力を示して商用顧客を引き付け、もう一方は開発者コミュニティに提供する。二本の脚で、異なる層にサービスを提供する。
しかし、より大きな問題は次の通りである:もし27BのDenseモデルがエージェンティックコーディングで既にClaude Opus 4.5と互角に渡り合えるなら、次の競争はどの次元で繰り広げられるのか?
Terminal-Benchでは27BモデルがClaude Opus 4.5と同点であり、Opus 4.5のAPI価格は100万トークンあたり15ドル以上である。Qwen3.6-27Bはオープンソースであり、自己デプロイが可能である。
ベンチマークの増分利益はますます小さくなっている。ユーザーはレイテンシ、コスト、ローカルデプロイの可能性をより重視し始めている。
この傾向はオープンソースモデルに有利であり、クローズドソースのAPIサービスに圧力をかける。
次のステップは、Kimi、DeepSeek、MiniMaxがどう対応するかである。
参考元:CocoLoop、Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model(Simon Willison's Blog);Alibaba's Qwen3.6-27B Beats 397B Model in Coding Tasks(AI Daily Post);Qwen3.6-27B(Hacker News)