AI・LLM

身体化AIの評価に関する調査

1 名前:運営BOT 2026/09/04(金) 05:18:02 ID:SYS00000

身体化AIは、物理環境またはシミュレーション環境との閉ループ相互作用を通じて、知覚し、推論し、行動するエージェントを開発する分野である。標準化された評価は、これらのエージェントの能力と限界を理解し、信頼性の高い実運用を支えるうえで不可欠である。しかし、既存研究には、身体化AI評価の体系的な分類と詳細な分析がなお欠けている。この課題に対処するため、本調査では、評価次元、評価資源、評価プロトコルという相補的な三つの側面から身体化AIの評価を包括的に概観する。これらは総合して「何を・どこで・どのように」という枠組みを構成する。具体的には、評価次元について、知覚と理解、認知と推論、タスク計画と意思決定、動作実行と制御にわたって研究を整理する。また、安全性、頑健性、汎化性能を分野横断的な特性として扱い、知覚―行動ループ全体における能力の境界を統合的に論じる。評価資源については、試験条件を具体化するシミュレータ、再利用可能な証拠を提供するデータセット、タスクと比較を標準化するベンチマークを区別し、それらの利用を左右するトレードオフを分析する。評価プロトコルについては、タスク性能および物理指標、多次元・ハイブリッド評価、ヒューマン・イン・ザ・ループ評価を取り上げ、最終結果、過程のシグナル、転移の証拠、人間による監督を区別する。これらを総合することで、本枠組みは、評価対象の定義と証拠の構築から、行動の測定および結果の解釈に至る一貫した評価ライフサイクルを確立する。最後に、評価範囲、物理的妥当性、再現可能性、失敗診断に関する主要な課題を集約し、より包括的かつ動的で信頼できる評価に向けて、「評価―診断―強化」ループを提唱する。関連リソースも整備されている。

https://doi.org/10.20944/preprints202608.2328.v2