DeepInfraは5月4日、シリーズBで1億700万ドルを調達したと発表した。金額だけを見ればAIインフラ領域で最大級というわけではないが、投資家の顔ぶれにはかなり強いメッセージがある。
ラウンドは500 Globalが主導し、Nvidia Corp.、Samsung Next、Supermicro、A.Capital、Felicis、Peak6、Upper90、さらにGoogle初期のエンジニアであるGeorges Harikが参加した。
NVIDIAが独立系の「推論クラウド」スタートアップに出資するという構図は、数年前ならかなり珍しかった。当時、推論需要の多くは大手クラウドの内側に吸収されていたからだ。2026年になると、NVIDIAは独立した推論インフラ層に資金を入れ始めている。この層が単独の市場として立ち上がったということだ。
DeepInfraはどこまで来たのか
DeepInfraのCEOであるNikola Borisovは、発表文でこう述べている。
"Inference is no longer a thin layer - it's the system constraint that will define the majority of workloads."
言い換えれば、推論はもはや薄いAPIプロキシではない。これからの多くのワークロードを左右するシステム上のボトルネックそのものになっている。
- 190以上のオープンAIモデルをサポートしており、Llama、Qwen、DeepSeek、Mistralなどが含まれる。
- トークン処理量の30%以上がエージェント系ワークロードから来ている。通常のチャットではなく、自律エージェントによる利用だ。
- 米国内8カ所のデータセンターで、自社保有のGPUインフラを運用し、NVIDIA Dynamoの分散推論プラットフォームを使っている。
- GPU構成にはBlackwellとVera Rubinが含まれる。Vera Rubinは今年量産に入ったばかりで、NVIDIAとの関係の深さをうかがわせる。
- 同社は、週あたり5兆トークンを処理し、シリーズA以降でトークン量が25倍に増え、2026年初から売上が3倍になったとも説明している。
最も重要なのは30%という数字だ。エージェントのワークフローはチャットボットとは違う。1つのタスクで100個のツールを呼び出し、何十回もAPIを叩くことがある。ユーザーが一文を入力してから動く仕組みではなく、常時稼働に近い。従来のクラウドはこうした負荷を前提に作られていない。課金モデル、コールドスタートの前提、スケジューリングの考え方は、人間との対話ループに合わせて設計されてきた。
なぜ自社GPUが競争力になったのか
今回の資金調達の中心にあるのは、実は単純な話だ。DeepInfraはAWSのGPUを借りず、自社で購入して運用している。
ここ数年、AI推論を動かす標準的な方法は、AWS、GCP、AzureのGPUサービスを借りることだった。ただし、この3社は自らモデルAPIも売っている。価格は安くなく、コールドスタートの遅延も残る。Together、Fireworks、Groq、DeepInfraのような独立系推論クラウドがこの2年で伸びたのは、このミスマッチを突いたからだ。
DeepInfraは20倍のコスト効率改善をうたっている。この数字は比較条件に左右されるため、そのまま受け取るべきではない。ただ、オープンモデルを大規模に運用するチーム、たとえば月間アクティブユーザーが100万人規模のプロダクトなら、専用の推論クラウドへ移すことで請求額が半分以下になるケースは珍しくない。
推論クラウド市場の位置取り
| 企業 | 特徴 |
|---|---|
| Together AI | フルスタックで、独自のCUDA代替技術を持つ |
| Fireworks AI | Hugging Faceエコシステムとの結びつきが強い |
| Groq | LPU専用チップを軸にし、NVIDIAやAMDも注目してきた |
| Cerebras | 巨大なウェハースケールチップで、上場への道を進む |
| DeepInfra | 8カ所の自社運用データセンター、190以上のオープンモデル、エージェント用途への集中 |
DeepInfraは評価額で最も目立つ会社ではないが、立ち位置は明確だ。オープンモデル専用の推論インフラに集中し、クローズドモデルの代理販売やモデル層の競争には踏み込まない。Togetherに近いが、違いはDeepInfraがGPU、スケジューリング、APIまで自社で強く握っている点にある。
本当の賭けはエージェント化
Borisovの「推論がシステム制約になる」という言葉は、単なる宣伝文句ではない。
エージェント型ワークフローが主流になると、1人のユーザーの裏側で毎分何十回もの推論が走る可能性がある。 Cursorがコードを書き、Claude Codeがファイルを編集し、SalesforceのAgentforceが問い合わせを処理する。これらは、ユーザーが一文を入力し、モデルが一度返すChatGPT型の負荷とはまったく別物だ。
この環境でp99レイテンシを抑え、コストも下げ、さらにゼロデータ保持を保証できる事業者が、企業顧客との契約を取ることになる。
DeepInfraの今回の資金調達資料では、以前よりも「agentic workloads」という言葉が目立つ。今後1年、この市場で問われるのはモデル数の多さではなく、「同時に何千ものエージェントが推論を呼ぶ」状況に耐えられるインフラを持つかどうかだ。
NVIDIAが自ら出資したのは、その局面が本当に来ると見ているからかもしれない。
参考資料:DeepInfra Closes $107M Series B to Power Production-Scale AI Inference(GlobeNewswire);Deepinfra lands $107M in funding to build out its dedicated inference cloud for open-source models(SiliconANGLE);CocoLoop;DeepInfra Raises $107M Series B to Scale Inference Infrastructure(DeepInfra Blog)