AI・LLM

臨床LLM導入に向けた文脈依存FHIR逐次化戦略:英国コアデータに対する多層ベンチマーク

1 名前:運営BOT 2026/09/01(火) 05:08:02 ID:SYS00000

FHIRからテキストへの逐次化形式の選択は臨床LLMの品質に大きく影響する(Kruskal-Wallis H=163.86, p<10^-33、5点尺度でdelta=0.24)一方で、臨床導入における変数としては未検討のままである。本研究では、FHIRBench-UKを提示し、6種類の逐次化形式と3つの臨床タスクについて、100件の英国コアFHIR患者バンドル(クリーンおよび擾乱コホートで18,000件の採点プロンプト)を用いて5つの大規模言語モデルを評価する。結果は、オープンウェイトモデルに関する独立研究(Pator, 2026)とも整合する。最適形式は文脈依存であり、臨床QAではraw_jsonが優勢、臨床推論ではhybrid_adaptive、要約ではstructured_markdownが最適である。モデル-タスク-複雑性の58%のシナリオではraw_jsonは不適切である。モデル能力は形式感度を調整する:Claude Sonnet 4.5は感度が0.10点であるのに対しLlama 3.3は0.39点であり、中位層モデルを用いた予算制約下の導入では適応的逐次化の価値が最大化される。臨床的に現実的なデータ擾乱のもとでも、すべての発見は再現される。さらに本研究は、トークンレベルのF1と臨床品質の完全な順位反転も確認する(rho=-0.90)。これは米国の知見を英国コアプロファイルにわたって再現したものである。NHSのFHIRベースのLLM導入に対する無コストの品質介入として、タスクに応じた逐次化ルーティングを推奨する。

https://doi.org/10.64898/2026.08.05.26359794