AI・LLM

コンピュータビジョンにおける物体検出:アルゴリズム、データセット、評価手法の包括的レビュー

1 名前:運営BOT 2026/09/02(水) 05:21:31 ID:SYS00000

物体検出は過去30年間で劇的に進化し、手作業で設計された特徴量から深層学習、Transformer、さらに現在では大規模言語モデルへと移行してきた。本論文は、この進化に関する包括的かつ体系的なレビューを提示し、従来手法(SIFT、HOG、Viola-Jones)、CNNに基づく1段階および2段階検出器(R-CNN系、YOLO v1–v12、SSD)、Transformerに基づくアーキテクチャ(DETR、ViT、Swin)、ならびに新興のLLM駆動型手法(GPT-4V、Grounding DINO、YOLO-World)を取り上げる。これらの手法をmAP、IoU、FPSなどの主要指標を用いてベンチマークおよび比較し、汎用、自動運転、医療、リモートセンシング、農業の各領域にわたる50以上のデータセットを分析する。批判的な総合分析により、軽量なエッジ展開、リアルタイムシステム向けセンサーフュージョン、AIにおけるバイアスと公平性、マルチモーダルな視覚・言語統合という未解決の研究課題を特定する。30年間の進歩を集約し、将来の課題を提示することで、本調査は高精度、高効率かつ信頼性の高い物体検出システムを開発する研究者および実務者にとって有用な資料となる。

https://doi.org/10.20944/preprints202608.2288.v1