DeepInfra cho biết ngày 4/5 rằng công ty đã huy động được 107 triệu USD trong vòng Series B. Con số này không phải lớn nhất trong mảng hạ tầng AI, nhưng danh sách nhà đầu tư lại rất đáng chú ý.
Vòng gọi vốn do 500 Global dẫn dắt, với sự tham gia của Nvidia Corp., Samsung Next, Supermicro, A.Capital, Felicis, Peak6, Upper90 và Georges Harik, một kỹ sư đầu tiên của Google.
Việc Nvidia đầu tư vào một startup "đám mây suy luận" độc lập là điều vài năm trước còn khá hiếm. Khi đó, phần lớn nhu cầu suy luận vẫn nằm trong các nền tảng đám mây lớn. Đến năm 2026, Nvidia bắt đầu rót vốn vào một lớp hạ tầng suy luận độc lập, cho thấy lớp này đã tách ra thành một thị trường riêng.
DeepInfra đã đi đến đâu
CEO DeepInfra Nikola Borisov nói khá thẳng trong thông báo:
"Inference is no longer a thin layer - it's the system constraint that will define the majority of workloads."
Nói cách khác, suy luận không còn là một lớp API mỏng. Nó đang trở thành nút thắt hệ thống quyết định phần lớn khối lượng công việc sắp tới.
- Hỗ trợ hơn 190 mô hình AI mở, gồm Llama, Qwen, DeepSeek, Mistral và nhiều mô hình khác.
- Hơn 30% thông lượng token đến từ khối lượng công việc tác nhân, tức autonomous agents, không phải chat thông thường.
- 8 trung tâm dữ liệu tại Mỹ vận hành hạ tầng GPU tự sở hữu, chạy nền tảng suy luận phân tán Nvidia Dynamo.
- Cụm GPU gồm cả Blackwell và Vera Rubin. Vera Rubin mới được sản xuất hàng loạt trong năm nay, nên khả năng tiếp cận dòng này cho thấy quan hệ không bình thường với Nvidia.
- Công ty cũng cho biết mỗi tuần xử lý 5 nghìn tỷ token, lượng token tăng 25 lần kể từ Series A và doanh thu đã tăng gấp ba từ đầu năm 2026.
Con số đáng xem nhất là 30%. Luồng công việc của tác nhân khác chatbot. Một nhiệm vụ có thể gọi hàng trăm công cụ và chạy hàng chục lần API. Nó luôn hoạt động ở nền sau, không phải chỉ bắt đầu khi người dùng gõ một câu. Đám mây truyền thống không giỏi kiểu tải này, vì mô hình tính phí, giả định cold start và thuật toán lập lịch đều được thiết kế cho tương tác giữa người và máy.
Vì sao GPU tự sở hữu bỗng thành lợi thế
Câu chuyện cốt lõi của vòng gọi vốn này thật ra nằm ở đây: DeepInfra không thuê GPU của AWS, mà tự mua và tự vận hành.
Trong vài năm qua, cách tiêu chuẩn để chạy suy luận AI là thuê dịch vụ GPU của AWS, GCP hoặc Azure. Vấn đề là ba công ty này cũng bán API mô hình của chính họ, giá không rẻ và vẫn có độ trễ cold start. Together, Fireworks, Groq và DeepInfra cùng nổi lên trong hai năm qua vì khai thác đúng sự lệch pha này.
DeepInfra tự công bố hiệu quả chi phí tăng 20 lần. Con số đó cần được đọc thận trọng vì phụ thuộc vào cách so sánh. Nhưng nếu một nhóm chạy mô hình mở ở quy mô lớn, chẳng hạn sản phẩm có hàng triệu người dùng hoạt động hằng tháng, chuyển sang loại đám mây suy luận chuyên dụng này thường có thể giảm hóa đơn hơn một nửa.
Cục diện mảng đám mây suy luận
| Công ty | Đặc điểm |
|---|---|
| Together AI | Nền tảng full-stack, tự phát triển giải pháp thay thế CUDA |
| Fireworks AI | Gắn chặt với hệ sinh thái Hugging Face |
| Groq | Dựa trên chip LPU chuyên dụng, từng được Nvidia và AMD chú ý |
| Cerebras | Chip wafer-scale khổng lồ, đang trên đường ra thị trường đại chúng |
| DeepInfra | 8 trung tâm dữ liệu tự vận hành, hơn 190 mô hình mở, đặt trọng tâm vào tác nhân |
DeepInfra không phải cái tên nổi bật nhất về định giá, nhưng vị trí của họ rất rõ: hạ tầng suy luận dành cho mô hình mở. Công ty không làm đại lý cho mô hình đóng và không lao vào cuộc đua ở lớp mô hình. Cái tên gần nhất để so sánh là Together, nhưng DeepInfra khác ở chỗ họ nắm quyền kiểm soát sâu hơn với toàn bộ stack, từ GPU, lập lịch đến API.
Tác nhân mới là ván cược thật sự
Câu nói của Borisov rằng suy luận là nút thắt hệ thống không chỉ là lời PR.
Khi luồng công việc tác nhân trở thành phổ biến, mỗi người dùng có thể kích hoạt hàng chục lần suy luận mỗi phút ở phía sau. Cursor viết mã, Claude Code sửa tệp, Agentforce của Salesforce xử lý phiếu hỗ trợ; các tình huống này khác hẳn kiểu ChatGPT khi người dùng hỏi một câu và mô hình trả lời một lần.
Nhà cung cấp nào có thể giữ độ trễ p99 thấp, kiểm soát chi phí và bảo đảm không lưu dữ liệu trong bối cảnh đó sẽ có lợi thế lớn khi ký hợp đồng doanh nghiệp.
Trong ngôn ngữ gọi vốn lần này của DeepInfra, cụm "agentic workloads" xuất hiện nhiều hơn các vòng trước. Trong một năm tới, đường đua này sẽ không chỉ so xem ai có danh mục mô hình rộng hơn, mà xem hạ tầng của ai chịu được cảnh hàng nghìn tác nhân cùng lúc gọi suy luận.
Việc Nvidia tự mình tham gia đầu tư có thể là dấu hiệu rằng họ tin kịch bản đó thật sự đang đến.
Nguồn: DeepInfra Closes $107M Series B to Power Production-Scale AI Inference (GlobeNewswire); Deepinfra lands $107M in funding to build out its dedicated inference cloud for open-source models (SiliconANGLE); CocoLoop; DeepInfra Raises $107M Series B to Scale Inference Infrastructure (DeepInfra Blog)