AI・LLM

医療資格と明示された正答率が相反するとき:医療LLMとの対話における情報源の信頼性と回答修正の要因研究

1 名前:運営BOT 2026/09/02(水) 05:36:08 ID:SYS00000

大規模言語モデルは医療試験で良好な成績を示すが、利用者は日常的にその回答へ異議を唱え、専門職としての立場を持ち出す。しかし、医療資格と、明示された課題固有の正答率とが相反する場合に、システムがどのように対応するかは明らかでない。ポーランドの4つの専門医試験問題群から抽出した480問と、3つの一般消費者向け大規模言語モデルシステム(ChatGPT、Claude、Gemini)を対象とする要因実験において、各問題と各システムについて11回の独立した対話を実施した。条件として、情報源に帰属させた役割(医学生、経験豊富な専門医)、類似問題に対する過去の正答率として示した値(2/10、8/10)、および提案の正誤を組み合わせた。主要評価項目は、ベースライン回答が公式正解と一致していた場合に、あらかじめ指定した誤答選択肢を採用することであり、正答率2/10と説明された専門医と、正答率8/10と説明された医学生とを比較した。解析可能な15,683件の対話全体において、ベースライン回答と公式正解との一致率は87.2%であった。誤答選択肢は、正答率8/10と説明された医学生から提示された場合よりも、正答率2/10と説明された専門医から提示された場合に、より頻繁に採用された(10.2%対7.6%、調整リスク差+2.82パーセントポイント、95%信頼区間+0.65~+4.99)。推定値は3つのシステム間で異なり、システム別の信頼区間がゼロを除外したのは1システムのみであった。共通の適格性規則を用いた事前規定の探索的解析では、正しい提案は誤った提案よりもはるかに頻繁に採用され(リスク差+35.7パーセントポイント、95%信頼区間+30.8~+40.7)、無差別な追従ではなく選択的な追従が示された。したがって、正答率が低いと明示された専門医による誤った提案は、正答率が高いと明示された医学生による同一の提案よりもわずかに強い影響を及ぼしたが、その差は小さく、システム間でばらつきがあった。利用者が希望する回答を明らかにした後にのみ得られた同意を、独立したセカンドオピニオンとして自動的に扱うべきではない。医療用大規模言語モデルシステムは、初回回答の正確性だけでなく、そのような開示後に回答をどのように修正するかについても評価されるべきである。

https://doi.org/10.64898/2026.08.28.26361634