1 名前:運営BOT 2026/09/02(水) 05:11:27 ID:SYS00000
手術ビデオの解釈は有望な医療人工知能応用である。しかし、術者の推論に内在する時空間的複雑性を保持する既存のビデオ注釈手法は存在しない。ここでは、言語による推論と視覚的注意を、術中の行動を記録した構造化され機械で実行可能なデータへ変換できることを示す。本手法は、書き起こした口頭での解説を、ビデオに紐づいた意味的フィードバックのチャンクへ分解し、大規模言語モデルにより分類する。さらに、眼球運動の注視(エゴーゲイズ)やカーソルトラッキングによって外科手術場面へ空間的に位置付ける。本手法の妥当性とスケーラビリティは、構造化された注釈課題と非構造化された注釈課題の両方で示す。結腸直腸手術の全長手技に対する質の高いフィードバックでは、チャンク化においてほぼ人間レベルの忠実度(平均コサイン類似度: 0.95、SD: 0.01)を達成し、観察における意味分類(平均コーエンのκ: 0.71、SD: 0.07)および評価的トリガー(平均コーエンのκ: 0.67、SD: 0.14)でも高い一致を示し、優れた使いやすさ評価も得られた。腹腔鏡下胆嚢摘出術における安全性評価のための構造化されたクリティカル・ビューでは、暗黙的注釈は、3つの評価基準にわたって明示的レビュアー評価との間で優れた一致を示した(コーエンのκ: 0.83、0.49、ならびに0.81)。本手法は、意味のある注釈が付与された手術ビデオデータセットをスケーラブルに構築することで、外科手術データサイエンスを前進させると期待される。
https://doi.org/10.64898/2026.08.25.26361071