まずはこの数字から:SWE-bench Pro 53.5 vs 50.9。
前者はQwen3.6-27B、270億パラメータのモデルで、4月22日にApache 2.0ライセンスでオープンソース化されました。後者はQwen3.5-397B、3970億パラメータの混合専門家モデル(MoE)で、アリババの従来の主力モデルです。
270億パラメータの小規模モデルが、約400億の活性化パラメータを持つ大規模モデルをソフトウェアエンジニアリングベンチマークで打ち負かすのは、決して小さな出来事ではありません。
Thinking Preservation:これが鍵
正直なところ、少ないパラメータで強い性能を出すという話は、この分野では何度か見られてきました。Qwen3.6-27Bがこの成果を出せた核心は、アーキテクチャそのものではなく、新機能のThinking Preservation(思考保持)にあります。
オープンソースLLMには見過ごされがちな問題があります。エージェントがマルチターンタスクを実行する際、各ターンの推論プロセスが破棄されることです。モデルは毎回コンテキストから再推論する必要があり、以前に構築した認知チェーンを再利用できません。
Qwen3.6-27Bのアプローチは、履歴メッセージ内の「思考の軌跡」を永続的なコンテキストとして保持することです:
「以前の推論を破棄するのではなく、会話全体にわたって履歴メッセージからの思考の軌跡を保持し活用することで、マルチターンエージェントワークフローの効率を向上させる」
平たく言えば、モデルが以前にどう考えたかを記憶し、毎回ゼロからリセットしないということです。
エージェント型コーディングタスクでは、この差は顕著です。同じコードリポジトリを扱う場合、前回の推論結論を記憶しているモデルと記憶していないモデルでは、パフォーマンスに大きな差が出ます。SWE-bench Proは実際のコードベースタスクを実行するテストであるため、この利点はさらに拡大されます。
ベンチマーク概要
SWE-benchだけでなく、Qwen3.6-27Bの性能は全般的に優れています:
| ベンチマーク | Qwen3.6-27B | 比較 |
|---|---|---|
| SWE-bench Pro | 53.5 | vs Qwen3.5-397B MoE: 50.9 |
| Terminal-Bench 2.0 | 59.3 | Claude Opus フラッグシップと同等 |
| AIME26(数学競技) | 94.1 | vs Qwen3.5-27B: 92.6 |
| QwenWebBench | 1487 | vs Qwen3.5-27B: 1068(+39%) |
| SkillsBench 平均 | 48.2 | 前世代同サイズモデル比77%向上 |
| GPQA Diamond | 87.8 | vs Qwen3.5-27B: 85.5 |
SkillsBenchの77%向上は特筆に値します。このベンチマークは分野横断的な汎用能力を測定します。Qwen3.5-27BからQwen3.6-27Bへの進化は、小幅な改良ではなく、システムレベルの再構築です。
コンテキストウィンドウ
ネイティブで262,144トークン(約20万中国語文字)をサポートし、YaRNを使用して1,010,000トークンまで拡張可能です。
長いコードリポジトリや長文書を扱う必要があるシナリオでは、このコンテキストで十分です。
オープンソースの意味
Apache 2.0ライセンスで、商用利用に制限はありません。
これは企業にとって、性能数値そのものよりも現実的な意味を持ちます。270億パラメータのモデルは、3970億パラメータのモデルよりもローカル展開コストがはるかに低く、しかも中核タスクではより高いスコアを達成します。この組み合わせは、自社でAI機能を構築したい企業にとって非常に魅力的です。コンシューマーグレードのGPU1枚で27Bモデルを実行できる一方、397Bモデルには少なくとも複数のハイエンドマシンが必要です。
これこそが、SkillsBenchの77%という数字が重要である理由でもあります。コードだけでなく、汎用能力が全面的に向上していることこそが、大規模モデルを真に置き換えるための前提条件です。
今週の構図
今週は偶然にも、OpenAIがGPT-5.5を、アリババがQwen3.6-27Bをリリースしました。
両方を合わせて見ると、クローズドソースのフラッグシップは「より高速で、よりトークン効率の高い」方向を追求し、オープンソースの小規模モデルは「より少ないパラメータでより良い結果を出す」方向を追求しています。方向性は異なりますが、互いの領域を圧迫し合っています。
次に覆されるのは、特定の企業ではなく、「良いコードを実行するには大規模モデルが必要だ」という前提そのものかもしれません。
出典:CocoLoop、Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks(MarkTechPost)