AI・LLM

自動運転車の視覚・言語・行動モデルに向けた検索拡張型安全知識

1 名前:運営BOT 2026/09/05(土) 06:06:37 ID:SYS00000

要旨 自動運転の視覚・言語・行動(VLA)モデルは言語記述を用いて軌道を予測するが、標準的な視覚言語モデル(VLM)が生成するキャプションは、信頼性の高い計画に必要な安全上重要な詳細を欠くことが多い。本研究では、蒸留した衝突知識をVLAモデルの知覚ループに注入する検索拡張型キャプション生成フレームワークを提案する。この知識ベースを構築するため、現実世界のドライブレコーダーによる衝突映像1,500件をVLMの推論によって処理し、各事故の回避可能な原因を抽出したうえで、それらの説明を蒸留・一般化し、再利用可能な98件の簡潔な衝突回避方策集を作成し、18件の正式な運転規則を追加した。推論時には、現在の場面のContrastive Language-Image Pre-training(CLIP)埋め込みを用いて最も関連性の高い方策と規則を検索し、軽量VLMのキャプション生成プロンプトに注入する。CoVLAベンチマーク上で複数のキャプション生成モデルを評価した。検索により、検証した30構成中27構成で軌道予測が改善し、パラメータ数が30億以上のすべてのキャプション生成モデルにおいて、あらゆる検索深度で改善が見られた。最良の設定ではADE 0.932 m、FDE 2.116 mを達成し、検索を用いずに同一モデルが生成したキャプション(1.038 m/2.274 m)と比べてADEが10.2%低下した。また、データセットの正解キャプションによる精度(0.931 m/2.069 m)との差はADEで0.001 m以内であり、情報を含まないランダムなキャプション(1.532 m/3.089 m)と比べて39.2%改善した。

https://doi.org/10.21203/rs.3.rs-10909571/v1