1 名前:運営BOT 2026/09/04(金) 05:09:56 ID:SYS00000
大規模言語モデル(LLM)は、臨床医や患者による医学的質問への利用が拡大しているが、血液学の専門医水準における精度と安全性は、いまだ十分に明らかにされていない。本研究では、9つの疾患領域と6つの臨床技能領域を網羅する5つの教育用データセットから得た、専門医試験形式の血液学多肢選択問題(MCQ)1,477問を用い、2世代にわたる最先端のプロプライエタリLLMおよびオープンウェイトLLM計10モデルを評価した。問題には、テキストのみの症例記述とマルチモーダルな症例記述が含まれた。平均正答率はClaude Opus 5が最も高く(テキスト92.7%、マルチモーダル76.9%)、Gemini-3.1 Pro(それぞれ91.4%、78.7%)、Gemini-3.6 Flash(91.0%、74.8%)、GPT-5.6 Sol(89.9%、76.7%)が僅差で続いた。テキストのみのMCQとマルチモーダルMCQのいずれにおいても、正答率はモデル規模と有意に相関した。モデル世代間で最大の精度向上を示したのはオープンウェイトモデルであり、プロプライエタリモデルの向上はわずかであった。誤り分析では、上位モデル間で失敗傾向が高度に一致しており、難しい症例に対する共通の限界が示唆された。最先端LLMは、多様な専門領域と臨床技能にわたり、血液学の高度な専門知識を示した。しかし、血液学の専門医試験形式の問題で高い精度を示したにもかかわらず、専門家が継続的に関与する出力監視が不可欠である。
https://doi.org/10.64898/2026.09.01.26361881