AI・LLM

アルコール、薬物、自傷に関連する受診の半数はコード化された救急部門データから特定できない:大規模言語モデルの診断精度研究

1 名前:運営BOT 2026/09/02(水) 05:18:33 ID:SYS00000

目的 救急部門(ED)の受診におけるアルコール、薬物、自傷の関与を特定する際の、臨床コーディング、臨床医によるレビュー、施設内に導入された大規模言語モデル(LLM)の精度を測定し、その有病率を定量化すること。研究デザイン 2段階の診断精度研究。検証週には、意見の不一致を裁定した参照基準(n=2,256)に照らして各特定手法を評価し、その後、同一施設における年間受診105,096件にLLMを適用した。研究環境 16歳以上の患者を診療する英国のタイプ1救急部門。主要評価項目 参照基準と比較した有病率の定量化、各手法の感度、特異度、バランス精度、月別特定率、および調整済み年間有病率。結果 参照基準では、受診の12.1%にアルコール、薬物、または自傷の関与が認められた(コーディング6.0%、臨床医10.0%、LLM 15.6%)。LLMのバランス精度は、3領域すべてにおいて臨床医によるレビューと同等またはそれを上回った(アルコール0.942対0.930、p=0.635、薬物0.959対0.791、p<0.001、自傷0.982対0.908、p=0.004)。特定された患者1人当たりに記録された領域数は、参照基準の1.32に対してコーディングでは1.07であった。調整済み年間有病率から、コード化データでは特定できない領域関与が年間12,890件に相当すると推定された。下位領域の分類では、自傷関連受診の少なくとも81.6%が、精神科による評価の前に、負傷または過量摂取に対する医学的評価を必要としていた。結論 臨床コーディングで特定されたアルコール、薬物、自傷に関連する受診は半数未満であり、複数領域の併存が記録されることはまれであった。過少記録は年間を通じて認められた。施設内に導入されたLLMは、NHSのインフラ内に存在する臨床テキストから、手作業によるレビューでは実現不可能な規模で、より完全な構造化データを生成した。

https://doi.org/10.64898/2026.08.26.26361443