4月16日、AlibabaのQwenチームはQwen3.6-35B-A3BをApache 2.0ライセンスでオープンソース化した。商用利用に制限はない。
このモデルの特徴は、総パラメータ数35Bでありながら、推論時に活性化するのは3Bのみという点にある。混合エキスパート(MoE)アーキテクチャを採用し、計算スパース比は12:1。35Bの高密度モデルに近い性能を、3Bモデル相当の実行コストで実現する。
SWE-bench Verified(実際のGitHub Issue修正テスト)では73.4%を記録。比較対象として、Googleがオープンソース化したGemma 4-31Bは52.0%で、21ポイントの差がついた。
アーキテクチャが重要な理由
まずMoEの設計ロジックについて説明する。
通常の高密度モデルでは、各トークンの処理にすべてのパラメータが関与する。35Bパラメータのモデルでは、トークンごとに35Bの計算が必要となる。
MoEは異なる。パラメータを多数の「エキスパート」に分割し、トークンごとにその一部のみを活性化する。Qwen3.6-35B-A3Bのルーティング機構は、各トークンの処理に3Bパラメータ相当のエキスパートグループのみを呼び出すが、モデル全体としては35Bパラメータの知識容量を保持している。
結果として、推論速度とメモリ使用量は3Bモデル相当でありながら、問題解決能力は35Bモデル相当となる。
RTX 4090上では毎秒120トークン以上の速度で動作する。64GBのMacBook Pro M4/M5でも直接実行可能だ。Q4_K_M量子化後は約21GBとなり、一般的なコンシューマ向けGPU1枚で動作する。
これはローカルデプロイにとって大きな意味を持つ。従来、最先端のオープンソースコーディングモデルを実行するには、少なくともA100または複数枚のRTX 4090が必要だった。現在はコンシューマ向けGPU1枚で十分だ。
他モデルとの比較
Google Gemma 4-31Bとの比較:
| ベンチマーク | Qwen3.6-35B | Gemma 4-31B |
|---|---|---|
| SWE-bench Verified | 73.4% | 52.0% |
| Terminal-Bench 2.0 | 51.5% | 42.9% |
| MCPMark(ツール呼び出し) | 37.0% | 18.1% |
| GPQA(汎用推論) | 86.0% | 84.3% |
| AIME26(数学コンテスト) | 92.7% | 89.2% |
ツール呼び出し(MCPMark)では、Qwen3.6はGemma 4の2倍以上のスコアを記録した。このベンチマークは実際のエージェントタスクでのパフォーマンスに直接対応しており、SWE-benchよりも実使用に近い。
QwenWebBench(Webタスク)では1397 ELOを獲得し、前世代比43%の改善となった。
Claude Sonnet 4.5との比較:
The Decoderの評価によると、純粋なコーディングベンチマークでは両モデルはほぼ互角で、差は測定誤差の範囲内だ。アシスタントスタイルの対話や一般的な雑談では、Claudeが依然としてリードしている。
オープンソースの詳細と利用方法
モデルウェイトはHugging Face(Qwen/Qwen3.6-35B-A3B)とModelScopeで入手可能。Transformers、vLLM(>=0.19.0)、SGLang(>=0.5.10)、KTransformersに対応している。
2つのモードをサポート:
- Thinkingモード:推論モデルに類似。多段階の深い思考を行い、推論プロセスを保持して後続の対話に引き継ぐ。
- Fastモード:直接出力。対話や軽量タスクに適する。
ネイティブのコンテキストウィンドウは262,144トークンで、YaRN拡張により100万トークン以上に対応可能。
APIはAlibaba Cloud Model Studio(名称「Qwen3.6 Flash」)からも利用可能で、自分でデプロイすることもできる。
このリリースの意義
これはAlibabaのオープンソース戦略における第3のステップだ。まずQwen3ベース版のオープンソース化(Apacheライセンス)、次にクローズドソースのQwen3.6-Plusエンタープライズ版のリリース、そして今回の高性能コーディング特化版Qwen3.6-35B-A3Bのオープンソース化である。
各ステップのリズムは明確だ。まずコミュニティと開発者基盤を構築し、クローズドソース版で収益化し、オープンソース版でエコシステムを深耕する。
Qwen3.6-35B-A3BのSWE-benchスコア73.4%は、オープンソースモデル全体でどのような位置づけになるのか。現時点でオープンソースで名を挙げているのはDeepSeek V4とこのモデル程度だ。クローズドソースではClaude Sonnet 4.5もこの領域にある。ローカルで実行可能なMoEモデルがこのスコアを達成したことは、確かに状況を変えつつある。
もちろん、SWE-benchの高スコアがそのまま実運用での優位性を保証するわけではない。コーディングエージェントの実際のパフォーマンスは、コンテキスト管理、エラー回復、長いフローの安定性にも依存する。これらはいずれもベンチマークでは測定されない。しかし、このスタートラインは真剣に評価する価値がある。
出典:CocoLoop、Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks(The Decoder);Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally(Build Fast with AI);Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model(DEV Community)