要旨 大規模言語モデルエージェントは、シェルコマンドの実行、サブプロセスの生成、ファイルやネットワークへの直接アクセスが可能である。その結果、プロンプトインジェクション、計画上の誤り、または侵害されたエージェントの挙動が、ツールレベルの検査を回避し、オペレーティングシステム上の副作用を引き起こし得る。本論文では、エージェントやそのポリシー提案を信頼することなく、人間が承認した損害境界を継続的に強制するLinux参照モニタ「Agent Guard」を提示する。モデルは「許可」「拒否」「外部送信禁止」という3値の資産契約を提案できるが、最終的な選択は人間による承認基盤が行う。実行ゲートは、信頼されないコードが実行される前に契約を導入し、具体的なカーネルタスクへ結び付ける。続いて、拡張Berkeley Packet Filter(eBPF)Linux Security Modules(LSM)のデータプレーンがファイルおよびネットワークに関する決定を強制し、プロセス生成、通常ファイル、FIFO、匿名パイプ、ならびに対応するUnixドメインソケットを通じて「外部送信禁止」状態を単調に伝播させる。19項目のセキュリティ特性、4構成によるコスト分解、および固定されたActPlaneベースラインを評価した。Agent Guardの正式なセキュリティ記録570件はすべて、事前定義された戻り値および副作用の基準を満たした。Linux 6.15を搭載したVMwareゲスト上で同時配置した3種類のファイルI/Oワークロードにおいて、Agent Guardのペア比較によるオーバーヘッド中央値は11.96~12.89%であり、固定されたActPlaneでは33.39~61.02%であった。これらの結果は、宣言済みの資産、対応する伝播経路、および制御されたオブジェクトのライフサイクルについて、人間が承認した損害境界を、決定論的なカーネル拒否と単調な実行時状態へ変換できることを示す。
https://doi.org/10.21203/rs.3.rs-10865359/v1