AI・LLM

安全なAIエージェントのツール実行に向けたケイパビリティ媒介型境界:条件付き非昇格不変条件と間接プロンプトインジェクションに対する実証評価

1 名前:運営BOT 2026/09/03(木) 05:48:44 ID:SYS00000

要旨 拡張可能なツールインターフェース(AnthropicのModel Context Protocolなど)を介して動作する自律型人工知能エージェントは、接続されたツールに対する環境権限を有する。自己回帰型Transformerは、命令と信頼できない第三者データを単一の均質なコンテキストウィンドウ内に取り込むため、敵対的な観測によってモデルが操作され、意図しない特権操作を実行する可能性がある。これは典型的な「混乱した代理人」問題である。本稿では、LLMエージェントを侵害され得る信頼できない主体として扱うべきだと論じる。さらに、ニューラルモデルを最終的なセキュリティ権限ではなく、意味的なフォールバックとして機能させる決定論優先のセキュリティアーキテクチャ「Mastyf Guard」を提示する。ツールのディスパッチは、完全仲介、最小権限、および型付きの4つの関係的引数不変条件(送信先の包含、スコープの有界性、権限の単調性、合計金額の上限制約)を強制する外部参照モニターによって統制される。信頼できるコンピューティング基盤について明示した参照モニターの完全仲介公理(A1~A6)の下では、スコープ外のツール実行確率はゼロとなる。これは定理1「信頼できるコンピューティング基盤上の条件付き非昇格不変条件」として形式化される。アーキテクチャ上の混同を避けるため、異なる2種類の実験ベンチマークを報告する。(1)50,000件の均衡化された事例(InjecAgent、BIPIA、Garakによる学術的攻撃25,000件と、真正な開発者トレース25,000件)を用いた過去のv1マクロ評価では、ベースラインのケイパビリティ境界がトランスポート境界において0.003ミリ秒で攻撃の82.40%を除去し、初期分類器と組み合わせた場合、償却後の高速経路オーバーヘッド0.005ミリ秒で再現率99.33%に達した。(2)3,000件の均衡化された企業向け事例を用いたMastyf Guard 2.0の評価では、決定論的な関係的リーフ走査だけで、レイテンシ17.3マイクロ秒、偽陽性率0.00%を維持しつつ攻撃の75.00%を検出した。また、証拠条件付き1.5Bニューラルフォールバックが構造的な見逃し500件中475件を回収し(V neural=95.0%)、ハイブリッド全体のカバレッジは97.50%となった。企業の良性操作2,000件における観測偽陽性率は0.00%(Wilsonの95%信頼区間:[0.00%、0.19%])であり、通常トラフィックにおけるP(fallback)は0.00%であった。対象シンクが認可されているツール横断的な情報流出については、DIFCに着想を得た明示的フロー動的テイントモニター(定理2)が、評価対象1,152件の100%を漏洩なく阻止した。Mastyf Guard 2.0は、実証評価済みの本番前セキュリティアーキテクチャとして位置付けられる。より広範な独立したライブエージェント、本番環境、および第三者による敵対的検証は、今後の課題として残されている。

https://doi.org/10.21203/rs.3.rs-10889863/v1