フランスのAI企業H Companyは9月28日、Hugging Face上で「コンピュータ操作エージェント」に特化したモデル群Holo4を公開した。画面のスクリーンショットを見てマウスをクリックし、キーボードを操作するほか、コードやMCP、APIを呼び出してタスクを完了できる。今世代の主力は2種類で、270億パラメータの高密度モデルHolo4-27Bと、総パラメータ350億・1回の推論で活性化するのは約30億という混合エキスパート(MoE)モデルHolo4-35B-A3B。いずれの重みもApache 2.0ライセンスで公開されている。
ほかに、NVIDIAのNemotron 3 Nano Omniをベースに学習したHolotron4 Nano(規模は30B-A3B)もある。
H Companyはパリに本社を置き、2024年創業。創業メンバーには元DeepMindの研究者が複数在籍し、創業年に約2.2億ドルのシード資金を調達した。Holoシリーズは同社の主力製品で、公式ブログによるとHolo4は前世代モデルをベースに追加学習したものだという。
ベンチマークと位置づけ
H Companyが主に用いる指標はOSWorld 2.0で、実際のデスクトップ環境で複数手順のタスクを完了させるベンチマークだ。公式ブログが示した比較は以下の通り。
- Holo4-27B: 61.7%
- Claude Opus 5.5: 81.8%
- Claude Opus 5: 70.2%
- GPT-5.6 Sol: 66.2%
この数字を見る限り、Holo4-27Bは前世代のクローズドモデルの最上位にかなり近づいたが、現行最強のOpus 5.5とはまだ明確な差がある。H Companyの説明では、Holo4は長時間タスクにおいて「最上位のクローズドモデルにしか及ばない」水準にあり、それでいてパラメータ数は数桁小さく、タスク単価も大幅に低いという。
コスト面の数字はモデルカードに記載されている。Holo4-35B-A3BはAutomationBenchで34.5%を記録し、タスク当たりのコストは約0.02ドル。ブログに掲載された他モデルのコストはグラフ上のみで、具体的な数値は示されていない。
デモには3Dモデリング、ゲームデザイン、企業の業務プロセス自動化などが含まれる。これらの数値はいずれもH Company自身のテスト環境で得られたもので、公式には自社のhai-agentsフレームワークとの併用が前提とされており、第三者による再現結果は現時点で出ていない。
中国の開発者にとっての意味
まず土台について。Holo4-35B-A3Bのモデルカードには、ベースモデルとしてアリババのQwen3.6-35B-A3Bが明記されており、最大コンテキストは262,144トークン。中国のチームはこのアーキテクチャのデプロイ、量子化、推論最適化に慣れており、Holo4の重みに置き換えても既存のツールチェーンをほぼそのまま使える。
ローカル環境で動くかについて。Holo4-27BはBF16、FP8、NVFP4、Q4 GGUFなど複数の形式で提供される。4bit量子化すれば、24GBのVRAMを持つ民生向けGPU1枚に収まる可能性がある。ただしこれは粗い見積もりで、実際はスクリーンショットの解像度やコンテキスト長次第だ。35B-A3Bは1回の推論で活性化するパラメータが約30億のみのため、推論速度でも有利になる。
コンピュータ操作エージェントには避けられない課題がある。画面のスクリーンショットを継続的にモデルへ送る必要がある点だ。OpusやGPTのようなクローズドモデルを使うと、スクリーンショットは海外クラウドにアップロードされるため、多くの金融、行政、製造業の内部ネットワークではそもそも許可されない。Apache 2.0ライセンスは商用利用や改変を認めており、ローカルのデータセンターで動かせて60%を超えるスコアを出せるオープンモデルは、こうした現場に現実的な選択肢を与える。
H Companyは自社のH Models API経由でホスティングサービスも提供しているが、価格はまだ公表されていない。
参考資料:H Company公式ブログ、Hugging Faceモデルカード、CocoLoop;OSWorld 2.0のスコアはH Companyのブログに基づき、AutomationBenchの成績とタスク単価はモデルカードの記載に基づく。いずれもベンダー自身による測定値。