要旨 拡張可能なツールインターフェース(AnthropicのModel Context Protocolなど)上で動作する自律型人工知能エージェントは、共有メモリ型コンピュータアーキテクチャにおける古典的な脆弱性を再現する。自己回帰型Transformerは、プログラム命令と信頼できない第三者データを単一の均質なコンテキストウィンドウ内に取り込むため、「認知的フォン・ノイマン混同」を被る。敵対的な観測は注意重みを変化させ、間接プロンプトインジェクション(IPI)を介してエージェントの実行方針を乗っ取り、エージェントを「混乱した代理人」へと変貌させ得る。本論考では、外部の能力仲介型トランスポート境界を通じて、データ取り込みと特権的なアクション実行を物理的に分離するアーキテクチャパラダイムである「認知的ハーバードアーキテクチャ」を定式化する。コンピュータシステムアーキテクチャ、AI安全性のレッドチーミング、形式手法、エンタープライズDevOpsにまたがる多角的な考察を統合し、能力ベースのエージェントセキュリティの理論的基盤を確立する。任意の軌跡長Tに関する数学的帰納法により、定理1(決定論的非干渉)を形式的に証明し、信頼できない観測が適用範囲外の状態変更ツールを起動する実行確率が厳密にゼロであることを示す。UIUC InjecAgent、Microsoft BIPIA、NVIDIA Garakから得た25,000件の敵対的インジェクションと、25,000件の正規の開発者DevOpsコマンドを対比した、均衡の取れた50,000件の実証サンプルによりMastyf Guardを評価する。Mastyf Guardは99.33%の脅威再現率(95%ブートストラップ信頼区間:[99.22%、99.43%]、B=1,000)と0.9524のF1スコアを達成し、Meta Llama Guard 3 8B(カイ二乗=7,156.1、p<10^-15)およびOpenAI Prompt Guard 86M(カイ二乗=11,496.9、p<10^-15)に対する統計的に決定的な優位性を確立した。特筆すべきことに、Mastyfは決定論的な高速経路の短絡処理により、標準的なCPUハードウェア上で4.8マイクロ秒(0.005ミリ秒)の償却済みパイプラインレイテンシを達成する。一方、単独のニューラル推論は1.1GBのRAM使用量で18.4ミリ秒で実行され、専用GPUインフラストラクチャの必要性をなくし、エージェントインスタンス当たり年間6,000ドルを節減する。
https://doi.org/10.21203/rs.3.rs-10868139/v1