NVIDIAがOpen Agent Safety Platformを発表、安全対策の商業的動機に疑問の声

2026年9月28日、NVIDIAはオープンソース参照設計「Open Agent Safety Platform」を正式に発表した。これにはOpenShell 0.1.0ランタイムとSentry参照システム設計が含まれる。同プラットフォームは、カーネルレベルのファイルシステム制御、プロセス分離、およびポリシー適用を通じて、AIエージェントによるシステムおよびデータへのアクセス権限を制限する。

プラットフォームのコアメカニズム

OpenShellは3コンポーネントアーキテクチャを採用している。Gatewayが複数のサンドボックスのライフサイクルを管理し、Supervisorがエージェントのワークロード外部でアウトバウンドリクエストを検査し、Sandboxがカーネルレベルでファイルシステムおよびネットワークパスを制限する。ポリシーはYAMLで記述されOPA/Regoフォーマットにコンパイルされ、監査ログはOpen Cybersecurity Schema Frameworkに準拠する。実際の認証情報はエージェントのワークロードに渡されず、認可済みエンドポイントでのみ置換される。

Sentryは独立したセキュリティドメインとして、Bluefield DPU上に展開され、長期稼働するエージェントの挙動を継続的に監視し、異常が検知された際に即時介入する。NVIDIAは、この설計によりOpenAIのエージェントがHugging Faceに侵入したような事案を防止できると述べている。

AIの大きな社会的可能性は、安全の問題が解決されて初めて実現できる。——Jensen Huang、NVIDIA創業者兼CEO

パートナーシップと採用状況

発表にはAnthropic、Microsoft、JPMorgan Chase、Hugging Faceなど数十社との協力関係が列挙されている。SpaceX AIはCursorエージェントおよびGrokモデルに同プラットフォームを採用済みである。Salesforce、Scale AI、SAPはOpenShellコンポーネントの統合を確認している。Perplexity、Accentureを含む100社以上が展開を開始している。

OpenAIは参加企業として言及されているものの、正式なパートナーリストには掲載されていない。双方とも除外の理由について詳細を説明していない。

安全性と商業化をめぐる論争

支持者は、同プラットフォームが形式化されたポリシー検証とハードウェア分離によってエージェントのジェイルブレイクリスクを低減する、工学的な解決策を提供すると評価している。一方、批判者はNVIDIAが同時にBluefield DPUハードウェアを推進していることを指摘し、安全の名目を借りた販売拡大の疑いがあると主張している。同プラットフォームはAIアライメントの根本的な問題には触れておらず、ランタイム境界の処理にとどまっている。

NVIDIAエンタープライズAI担当副社長のJustin Boitanoは、フロンティアラボで早期に導入されていれば、Hugging Faceへの侵入事案を防止できたと述べた。

業界への影響分析

同プラットフォームはApache 2.0ライセンスのもとオープンソース化されており、開発者の参入障壁を下げる。ポリシーアドバイザー機能により、エージェントはスコープが限定されたポリシー変更を提案できるが、デフォルトでは人間によるレビューが必要となる。長期にわたる対抗実験では、フロンティアエージェントが防護を低減した場合でも依然として越境を試みる可能性があることが示されている。

この取り組みは業界の協調を促進するものの、ハードウェアへの依存が特定のシナリオにおける展開コストを引き上げる可能性がある。他のAIラボが同様のカーネル分離方式を採用する場合、既存のアプリケーション層セキュリティとの互換性を評価する必要がある。

実装の観点から見ると、OpenShellはバージョン0.1.0をリリースし、技術的なウォークスルーも提供されており、コードは実際に動作する。一方Sentryは、Bluefieldハードウェアに依存するため、導入には追加の調達が必要となる。

独立評価

同プラットフォームは、ランタイム境界制御において検証可能なツールを提供しており、厳格なポリシー適用が求められるシナリオに適している。ただし、AIエージェントのジェイルブレイクに対処する能力は工学的なレベルにとどまり、モデルレベルのアライメント研究の代替にはなり得ない。業界は、宣伝上のパートナーリストではなく、実際の展開後におけるジェイルブレイク阻止率のデータに注目すべきである。