フランスのAI企業Mistralは10月6日、Mistral Large 4のリサーチプレビュー版を公開した。社内では「le Chonk(でっかいやつ)」という愛称で呼ばれている。ネイティブなマルチモーダル構成のMoE(混合専門家)モデルで、総パラメータ数は1兆、トークンあたりの活性化パラメータは約490億、コンテキストウィンドウは512K。テキストと画像の入力、テキスト出力に対応する。
プレビュー版は現在Mistral API経由で提供されており、優先対象は開発者、セキュリティ責任者、政府機関。同社は今月後半に対象を広げ、10月末にオープンウェイトを公開する計画を明らかにしている。
学習と位置付け
Mistral公式ブログによると、Large 4は欧州の自社データセンターでゼロから学習され、使用したNVIDIA Grace Blackwell GPUは約3800基。CNBCの報道では学習期間は約2カ月とされる。Mistralが強みとして挙げるのは、サイバーセキュリティ、コーディング、製造、金融、マルチモーダルタスクだ。
同社は「中国以外では最強のオープンウェイトモデルであり、その差は大きい」とアピールしている。一方でCNBCの報道によれば、Mistral自身もコーディングなどの分野で最先端のクローズドモデルにはまだ及ばないと認めている。
APIには none と high の2つの推論モードがある。開発者のSimon Willisonが実際に試したところ、highモードの方が出力トークン数は少なく、平均2717トークン(noneモードは3275トークン)、かつ出力の質もhighの方が良かったという。彼の総合的な評価は、Large 4は最先端からおよそ半年遅れているというものだ。
第三者評価
独立評価機関Artificial AnalysisによるIntelligence Indexは38点。並べてみると:
| モデル | Intelligence Index |
|---|---|
| DeepSeek V4.1 Flash | 39 |
| Mistral Large 4 | 38 |
| GPT-6 Luna(max) | 38 |
| Mistral Large 3 | 9 |
前世代との差は29点に達し、前モデルLarge 3の9点はこの表の中でも明らかに低い位置にある。Artificial Analysisはこれを根拠に「米中以外では最も知能が高いモデル」と評している。同機関のサイバーセキュリティ指数ではLarge 4は50点を獲得したが、文書推論テスト(GDP.pdf)の通過率はわずか19%で、この項目は明らかに弱い。
コストを計算する
プレビュー版のAPI価格は、入力トークン100万あたり1.36ドル、出力は4.18ドル、キャッシュヒット時の入力は100万あたり0.14ドル。公開から最初の2週間は半額になる。Artificial Analysisが自社のタスクセットで換算したところ、1タスクあたりのコストは1.13ドル、割引期間中は0.57ドルという。
よくあるシナリオで概算してみる。100万トークンのコードベースや文書を入力し、20万トークンの出力を得る場合、通常価格では約2.2ドル、割引期間中は約1.1ドルとなる。出力の単価は入力の約3倍で、長い出力を要するエージェントタスクはより高額になる。
活性化比率も見ておく価値がある。総パラメータ1兆に対し活性化パラメータ490億は約4.9%で、前日発表されたReflection Beam(総パラメータ5010億に対し活性化230億、約4.6%)とほぼ同水準だ。推論コストは主に活性化パラメータに左右されるため、両社とも「効率」を強調している。
導入のハードルは別問題だ。8bit精度で見積もると、1兆パラメータの重みを保存するだけで約1TBのVRAMが必要になり、4bit量子化後でも約500GBに達する。オープンウェイトを手に入れたとしても、多くのチームはクラウド事業者によるホスティングに頼るか、コミュニティによる蒸留版の登場を待つことになりそうだ。
欧州というカード
Mistralは9月、サムスン主導で30億ユーロの資金調達を完了した。Large 4はこの資金調達後初のフラッグシップで、自社インフラと欧州拠点での学習という2点を同社は繰り返し強調している。宣伝の力点からは、欧州政府や規制業界の調達を狙っていることがうかがえる。
オープンウェイトのライセンス条件や具体的な公開日は、Mistralはまだ発表していない。現時点のスコアも公式およびごく一部の評価機関によるものにすぎず、コミュニティが実際にウェイトを手にした後にどこまで再現できるかは、今月末まで分からない。
参考資料: Mistral公式ブログ、Artificial Analysis、CocoLoop、CNBC、Simon Willisonのブログ。Intelligence Indexおよび1タスクあたりのコストはArtificial Analysisの公表データに基づき、API価格はMistralのプレビュー版価格に基づく。VRAM要件はパラメータ数に基づく概算。