AlibabaがQwen3.6-35Bをオープンソース化、SWE-benchで73.4%を達成

4月16日、AlibabaのQwenチームはQwen3.6-35B-A3BをApache 2.0ライセンスでオープンソース化した。商用利用に制限はない。

このモデルの特徴は、総パラメータ数35Bでありながら、推論時に活性化するのは3Bのみという点にある。混合エキスパート(MoE)アーキテクチャを採用し、計算スパース比は12:1。35Bの高密度モデルに近い性能を、3Bモデル相当の実行コストで実現する。

SWE-bench Verified(実際のGitHub Issue修正テスト)では73.4%を記録。比較対象として、Googleがオープンソース化したGemma 4-31Bは52.0%で、21ポイントの差がついた。

アーキテクチャが重要な理由

まずMoEの設計ロジックについて説明する。

通常の高密度モデルでは、各トークンの処理にすべてのパラメータが関与する。35Bパラメータのモデルでは、トークンごとに35Bの計算が必要となる。

MoEは異なる。パラメータを多数の「エキスパート」に分割し、トークンごとにその一部のみを活性化する。Qwen3.6-35B-A3Bのルーティング機構は、各トークンの処理に3Bパラメータ相当のエキスパートグループのみを呼び出すが、モデル全体としては35Bパラメータの知識容量を保持している。

結果として、推論速度とメモリ使用量は3Bモデル相当でありながら、問題解決能力は35Bモデル相当となる。

RTX 4090上では毎秒120トークン以上の速度で動作する。64GBのMacBook Pro M4/M5でも直接実行可能だ。Q4_K_M量子化後は約21GBとなり、一般的なコンシューマ向けGPU1枚で動作する。

これはローカルデプロイにとって大きな意味を持つ。従来、最先端のオープンソースコーディングモデルを実行するには、少なくともA100または複数枚のRTX 4090が必要だった。現在はコンシューマ向けGPU1枚で十分だ。

他モデルとの比較

Google Gemma 4-31Bとの比較:

ベンチマークQwen3.6-35BGemma 4-31B
SWE-bench Verified73.4%52.0%
Terminal-Bench 2.051.5%42.9%
MCPMark(ツール呼び出し)37.0%18.1%
GPQA(汎用推論)86.0%84.3%
AIME26(数学コンテスト)92.7%89.2%

ツール呼び出し(MCPMark)では、Qwen3.6はGemma 4の2倍以上のスコアを記録した。このベンチマークは実際のエージェントタスクでのパフォーマンスに直接対応しており、SWE-benchよりも実使用に近い。

QwenWebBench(Webタスク)では1397 ELOを獲得し、前世代比43%の改善となった。

Claude Sonnet 4.5との比較:

The Decoderの評価によると、純粋なコーディングベンチマークでは両モデルはほぼ互角で、差は測定誤差の範囲内だ。アシスタントスタイルの対話や一般的な雑談では、Claudeが依然としてリードしている。

オープンソースの詳細と利用方法

モデルウェイトはHugging Face(Qwen/Qwen3.6-35B-A3B)とModelScopeで入手可能。Transformers、vLLM(>=0.19.0)、SGLang(>=0.5.10)、KTransformersに対応している。

2つのモードをサポート:

  • Thinkingモード:推論モデルに類似。多段階の深い思考を行い、推論プロセスを保持して後続の対話に引き継ぐ。
  • Fastモード:直接出力。対話や軽量タスクに適する。

ネイティブのコンテキストウィンドウは262,144トークンで、YaRN拡張により100万トークン以上に対応可能。

APIはAlibaba Cloud Model Studio(名称「Qwen3.6 Flash」)からも利用可能で、自分でデプロイすることもできる。

このリリースの意義

これはAlibabaのオープンソース戦略における第3のステップだ。まずQwen3ベース版のオープンソース化(Apacheライセンス)、次にクローズドソースのQwen3.6-Plusエンタープライズ版のリリース、そして今回の高性能コーディング特化版Qwen3.6-35B-A3Bのオープンソース化である。

各ステップのリズムは明確だ。まずコミュニティと開発者基盤を構築し、クローズドソース版で収益化し、オープンソース版でエコシステムを深耕する。

Qwen3.6-35B-A3BのSWE-benchスコア73.4%は、オープンソースモデル全体でどのような位置づけになるのか。現時点でオープンソースで名を挙げているのはDeepSeek V4とこのモデル程度だ。クローズドソースではClaude Sonnet 4.5もこの領域にある。ローカルで実行可能なMoEモデルがこのスコアを達成したことは、確かに状況を変えつつある。

もちろん、SWE-benchの高スコアがそのまま実運用での優位性を保証するわけではない。コーディングエージェントの実際のパフォーマンスは、コンテキスト管理、エラー回復、長いフローの安定性にも依存する。これらはいずれもベンチマークでは測定されない。しかし、このスタートラインは真剣に評価する価値がある。

出典:CocoLoop、Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks(The Decoder);Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally(Build Fast with AI);Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model(DEV Community)