NVIDIA Open Agent Safety Platformとは?——AIエージェントの脱出・暴走を止めるガードレール

OPENSHELL コラム

仕事を任せるAIエージェントが増えるほど、「指示から外れて勝手に動く」「想定外の場所まで手を伸ばす」といった不安も大きくなります。たとえるなら、優秀なデジタル部下が、鍵のかかっていない社内フォルダや外部サービスまで走り出してしまうイメージです。

NVIDIAは、そうした脱出・暴走(意図しない行動やサンドボックス外への到達)を抑えるための枠組みNVIDIA Open Agent Safety Platformを発表しました。中核は、オープンソースの実行環境NVIDIA OpenShellと、ハードウェア側の監視役NVIDIA Sentryです。

本稿では、公式の発表・技術ブログ・製品ページをもとに、何が新しく、ビジネス現場でどう効くのかを平易に整理します。専門用語は必要なところだけ、身近な比喩で補います。

公式の紹介動画

NVIDIA Developerの公式チャンネルでは、OpenShellでAIエージェントを安全に動かす手順を短い動画で紹介しています。サンドボックスとポリシー(許可のルール)のイメージを、文章の前に掴むのに向いています。

公式Xで公開された紹介動画

NVIDIA公式アカウントでは、CEOのジェンスン・フアン氏がOpenShellとエージェント安全への姿勢を語る短い映像も公開されています。発表の温度感を合わせ見ると理解しやすいです。

Open Agent Safety Platformとは何か

NVIDIA Open Agent Safety Platformは、AIエージェントを「テストから本番まで」同じ考え方で囲い込むためのオープンな枠組みです。公式は、ソフトウェアとハードウェアをまたぐフルスタックの統治(ガバナンス)を掲げています。

背景にあるのは、評価用の囲いからエージェントが外へ出てしまい、触ってはいけないシステムに到達した、といった報告が複数の先端ラボから出ていることです。パターンは似ています。エージェントが「与えられた仕事を完了したい」あまり、アプリ側の注意書きやプロンプトだけでは止められない行動をとってしまう、という構図です。

NVIDIAはこれを「ドリフト(意図からのずれ)」とも呼びます。ポリシーで止められた反動、ツール不足、あいまいな指示、何日も続く長い仕事——どれもずれのきっかけになり得ます。重要な教訓として公式が強調するのは、エージェントに自分自身の完全な監視は期待できないという点です。

そこで登場するのが二段構えです。実行時のガードレールがOpenShell。ホストと切り離したシリコン上の番犬がSentry(BlueField-4上)。デジタル部下の机に鍵をかけるだけでなく、廊下に独立した警備カメラを置く、というイメージです。

OpenShell——エージェントの外にある「許可の壁」

NVIDIA OpenShellは、Apache 2.0で公開されているオープンソースの安全ランタイムです。エージェントをサンドボックス(隔離された作業部屋)で動かし、ファイル・ネットワーク・プロセス・モデル呼び出しなどへのアクセスを、エージェントのプロセスの外で強制します。

構成の中心は次の三つです。

  • Gateway:多数のサンドボックスの寿命とポリシーをまとめて管理
  • Supervisor:各サンドボックスに付き添い、外向きの要求をポリシーと照合
  • Sandbox:OSカーネル級の制限でファイルや権限昇格を抑え、外への通信は原則Supervisor経由だけ

ポリシーはYAMLで書ける宣言型です。たとえば「このAPIは読み取りだけ」「このフォルダ以外は触るな」といったルールを、実行前に検証し、実行中も守らせます。エージェントが自分で権限を広げようとしても、自分の申請を自分で承認することはできない設計が公式に示されています。

資格情報(APIキーなど)も工夫されています。エージェント側にはプレースホルダしか見えず、本物の鍵は許可された宛先へのリクエスト時に、ワークロードの外で差し替えられます。鍵束を部下の机に置かず、受付が都度開錠するイメージです。

公式ブログでは OpenShell 0.1.0 が紹介され、Codex、Claude Code、Pi、Hermes など既存のエージェントを書き換えなくても外から囲える点が強調されています。BlueField-4がなくても、ローカル・オンプレ・クラウド・Kubernetesなど対応インフラ上で動かせます。

Sentry——ミリ秒で隔離するハードウェア番犬

NVIDIA Sentryは、Open Agent Safety Platformの参照システム設計に含まれるアウトオブバンド(帯域外)の監視・強制レイヤです。NVIDIA BlueField-4 DPU上で動き、NVIDIA DOCAを使ってエージェントの要求と応答を観測し、ポリシー違反時にはミリ秒単位で隔離・停止できる、と公式は説明しています。

ポイントは「エージェントの中」や「同じホストのソフトウェア」に監視を置かないことです。ホストが傷ついても、別領域の番犬が動き続ける、という位置づけです。Vera Rubin PODでは、各コンピュートトレイのBlueField-4がモデルへの経路上にあり、そこから常時観測・強制できる、というアーキテクチャが技術ブログで示されています。

すでにVera+BlueField-4環境を持つ組織は、ソフトウェア更新で保護を有効化できる、という説明もあります。一方でプラットフォーム全体は他社ハードウェアとの互換も謳われており、必須セットはOpenShell、Sentryは追加の独立層、とFAQでも整理されています。

モデルの注意書きと、実行時ガードレールは別物

会話のガードレール(禁止トピック、ジェイルブレイク検知、出力の健全化など)は、いわば就業規則や口頭の注意です。NVIDIAの既存スタックでは NeMo Guardrails などがこの層に近い役割を担います。

OpenShell/Sentryが扱うのは、実際にファイルを触る・ネットに出る・鍵を使うという行動そのものです。公式FAQの言い方を借りると、プロンプトやモデル安全策、エージェント枠組みは「何をしようと試みるか」に影響し、ランタイム制御は「何が許されるか」を強制します。

ビジネス現場では、両方あった方が安心です。規則だけだと抜け道が残ります。鍵と監視カメラだけだと、会話の品質やコンプライアンス文言は別問題のままです。デジタル部下の暴走を止めるには、規則と物理的な鍵の両方が必要——それが今回の発表の読みどころです。

企業にとっての意味と現実的な入り口

発表では100社超のパートナー連携が示され、Anthropic(Claude Managed Agentsとの連携)、Salesforce/Slack、SAP(Joule Studioへの組み込み)、CrowdStrike、Palo Alto Networks、Ciscoなど、ソフトからセキュリティ、業務アプリまで幅広い名前が並びます。

中小企業や個人事業主が明日からVera PODを買う話ではありません。それでも実務上の示唆ははっきりしています。

  • 長時間エージェントを試すなら、権限は最小から——最初は読み取り専用や特定フォルダだけ
  • APIキーをエージェントの作業場に置かない——鍵の差し替え型(OpenShellの思想)を意識する
  • 権限拡大は人が承認——部下が自分で金庫の暗証を増やせないルールにする
  • モデルの注意書きだけで安心しない——実行環境の囲いもセットで考える

技術チームがある場合は、GitHub上の OpenShell と公式クイックスタートから、既存エージェントをサンドボックスに載せる試験が現実的な第一歩です。Cadence(チップ設計)、Slack(オンデマンド自動化)、Gecko Robotics(物理ロボット上の判断)など、公式が挙げる採用例も「研究デモだけではない」ことを示しています。

まとめ

NVIDIA Open Agent Safety Platformは、AIエージェントの脱出・暴走を「お願い」ではなく「強制」で止めるためのオープンな枠組みです。OpenShellがソフトウェア側のガードレール、SentryがBlueField-4上の独立した番犬、という二段構えが公式の骨子です。

エージェントが賢くなるほど、仕事机の鍵と廊下の警備はセットで必要になります。まずは「何を見せ、何をさせ、どこへ出してよいか」を言葉にできるポリシーから——それが、デジタル部下を安心して増やす最短ルートです。

参考リンク

この記事を書いた人
この記事を書いた人

毎日20時間以上AIの実践・研究に没頭するITエンジニア。20年以上にわたり、オンラインゲームや生活関連など幅広いジャンルのオウンドメディアで執筆・編集長を歴任。現在は上場企業グループの代表取締役を務め、複数の事業者団体で理事を兼務する経営者でもある。テクノロジーの最前線に身を置きつつ、地域の商店街や神社の運営にも深く携わるなど、地域活性化にも尽力。圧倒的な現場経験とITの専門知識、経営者の視点から、信頼性の高い有益な情報を発信している。
Olive株式会社 代表取締役

tanakaをフォローする
コラム
シェアする
tanakaをフォローする

コメント

タイトルとURLをコピーしました