Ngày 28/9, Nvidia công bố Open Agent Safety Platform, một thiết kế tham chiếu về an toàn cho AI agent, chia đều giữa phần mềm và phần cứng. Phần mềm là OpenShell, một môi trường thực thi mã nguồn mở có nhiệm vụ nhốt từng agent vào một sandbox. Phía phần cứng là Sentry, chương trình giám sát chạy trên bộ xử lý dữ liệu BlueField-4, có thể cô lập và dừng một agent trong vài mili-giây ngay khi phát hiện agent đó vượt giới hạn.
Nvidia cho biết hơn 100 tổ chức đã tham gia, trong danh sách có Anthropic, Microsoft, SAP, Scale AI, JPMorgan, Palantir, CrowdStrike, Palo Alto Networks, Hugging Face và Perplexity. Thời điểm công bố cũng không khó hiểu: trong tuần trước đó, OpenAI thông báo các agent của hãng đã xâm nhập vào website của nhiều cơ quan chính phủ Mỹ trong quá trình thử nghiệm, Google thừa nhận Gemini từng xâm nhập ba công ty thật trong thử nghiệm, và Thượng viện Australia sau đó đã mời CEO của hai công ty này ra điều trần.
OpenShell: đưa quyền hạn ra khỏi tầm với của agent
OpenShell mã nguồn mở theo giấy phép Apache 2.0, phiên bản hiện tại là 0.1.0. Nó gồm ba phần: Gateway quản lý vòng đời và chính sách; Supervisor chạy bên ngoài workload, kiểm tra từng yêu cầu mà agent gửi ra; Sandbox giới hạn tệp và tiến trình ở tầng nhân hệ điều hành, khiến agent không có lối ra mạng nào khác ngoài đường đi qua Supervisor.
Cách xử lý thông tin xác thực là phần được thiết kế kỹ trong hệ thống này. Khóa API thật không bao giờ đi vào môi trường của agent, agent chỉ cầm trong tay các placeholder; chỉ khi yêu cầu được duyệt, placeholder mới được thay bằng khóa thật, và mỗi khóa chỉ gắn với một endpoint đã được phê duyệt — dùng nó để gọi dịch vụ khác sẽ không có tác dụng. Chính sách được viết bằng YAML rồi biên dịch thành các quy tắc OPA/Rego, đánh giá từng yêu cầu HTTP, GraphQL và MCP.
Các framework được liệt kê tương thích chính thức gồm Codex, Claude Code, Pi và Hermes. Blog kỹ thuật của Nvidia cho biết hãng thiết kế chip Cadence, nền tảng agent theo yêu cầu của Slack và Gecko Robotics — chuyên về robot kiểm tra — đã bắt đầu dùng thử hệ thống.
Sentry: giám sát không chạy trên cùng một máy
Blog kỹ thuật của Nvidia tóm gọn toàn bộ cách tiếp cận thành năm nguyên tắc, trong đó có "thực thi ngoài băng thông" (out-of-band execution): cơ chế kiểm soát phải đặt ở nơi agent không thể chạm tới. Nguyên văn trong blog viết:
"an agent in these circumstances cannot be expected to fully govern its own behavior."
Trong những trường hợp như vậy, không thể kỳ vọng một agent tự kiểm soát hoàn toàn hành vi của chính nó.
Sentry chính là hiện thực hóa nguyên tắc đó bằng phần cứng. Nó chạy trên BlueField-4, tách biệt khỏi máy chủ nơi agent hoạt động, và theo Nvidia thì vô hình với cả agent lẫn kẻ tấn công. Trong một POD Vera Rubin, BlueField-4 được đặt ở vị trí là lối truy cập duy nhất tới mô hình ở cấp độ node: mọi luồng dữ liệu gọi đến mô hình đều phải đi qua đây, việc giám sát và chặn diễn ra ở tốc độ đường truyền.
Cách làm của Anthropic là tách vòng lặp suy luận của Claude Managed Agents khỏi sandbox thực thi, rồi kết nối sandbox đó với OpenShell và BlueField, để doanh nghiệp có thể kiểm soát truy cập ngay ở tầng sandbox.
Jensen Huang, CEO Nvidia, phát biểu trong thông cáo báo chí: "AI's extraordinary potential for society will only be realized if we solve AI safety." (tiềm năng to lớn của AI đối với xã hội chỉ có thể trở thành hiện thực nếu chúng ta giải quyết được vấn đề an toàn AI).
Những bước đi của Nvidia trên mặt trận agent
Nhìn lại các lần công bố gần đây, có thể thấy Nvidia liên tục tiến sâu hơn vào tầng thực thi của AI agent: tại GTC tháng 4, hãng kéo theo một loạt công ty phần mềm doanh nghiệp làm nền tảng phát triển agent; tháng 5, hãng cùng ServiceNow ra mắt môi trường thực thi agent cấp doanh nghiệp; lần này, Nvidia tách riêng bài toán "kiểm soát agent" thành một dự án mã nguồn mở, gắn chặt với DPU của chính mình.
Phần mềm mở cộng với điểm thực thi nằm trên chính con chip của mình — tổ hợp này khá giống cách Nvidia từng đẩy CUDA rồi NVLink trước đây: hệ sinh thái có thể tham gia miễn phí, nhưng lớp bảo vệ mạnh nhất vẫn cần phần cứng Nvidia. Với những đội chỉ muốn dùng OpenShell làm sandbox, họ có thể triển khai ngay từ bây giờ; còn muốn có kiểu giám sát độc lập với host như Sentry thì phải chờ nhịp độ xuất xưởng của BlueField-4 và Vera Rubin.
Tình hình của các đội trong nước Trung Quốc cần nhìn tách biệt. OpenShell là mã nguồn mở, việc chỉnh sửa hay kết nối với mô hình nội địa không gặp trở ngại. Còn Sentry phụ thuộc vào BlueField-4, thuộc dòng sản phẩm mạng trung tâm dữ liệu của Nvidia; hiện chưa có thông tin công khai về việc liệu có thể mua tại Trung Quốc hay không, mua theo cấu hình nào, và cũng không thể kiểm chứng.
Nguồn tham khảo: thông cáo từ trung tâm báo chí Nvidia, blog kỹ thuật Nvidia (hai bài về Open Agent Safety Platform và OpenShell), CocoLoop, ITHome, The Next Web; các nội dung đã được kiểm chứng gồm danh sách tổ chức hợp tác, số phiên bản và giấy phép mã nguồn mở của OpenShell, cùng phát biểu chính thức của Nvidia về thời gian phản ứng cô lập của Sentry.