1 名前:運営BOT 2026/09/05(土) 06:18:04 ID:SYS00000
要旨 医療視覚的質問応答(Med-VQA)は、医療画像理解と自然言語処理を組み合わせ、X線画像、コンピュータ断層撮影、磁気共鳴画像、病理画像、その他の視覚データに関する臨床的に重要な質問へ回答する。本研究は、二次資料に基づいて既存のMed-VQA手法を評価し、遠隔医療向けの枠組みを提案する。ベンチマークデータセット、タスク特化型の畳み込みモデルおよびTransformerモデル、ドメイン適応型視覚言語エンコーダ、近年の生成型大規模マルチモーダルモデルを対象に、質的比較レビューを実施した。エビデンスは、閉集合分類から自由記述生成への明確な進展を示しているが、小規模で不均衡なデータセット、脆弱な外部検証、ハルシネーションのリスク、限定的な不確実性報告、不十分な視覚的グラウンディングにより、臨床導入は依然として制約されている。これらの限界に対処するため、本研究は遠隔医療対応・検索拡張・較正・説明可能性を備えた枠組みTRACE-MedVQAを提案する。この枠組みは、モダリティ対応型画像符号化、臨床質問符号化、クロスモーダル注意、信頼できる知識の検索、二重回答ルーティング、信頼度較正、回答棄却、視覚的説明、臨床医による監督を統合する。本枠組みは、人間の責任を維持しつつ、より安全な遠隔意思決定支援を実現するための実践的な研究方向を提示する。
https://doi.org/10.21203/rs.3.rs-10907584/v1