AI・LLM

系統的レビューにおける費用効率の高い大規模言語モデル支援型タイトル・抄録スクリーニング:手法の評価と検証

1 名前:運営BOT 2026/09/05(土) 06:02:52 ID:SYS00000

要旨

背景:電磁界(EMF)の潜在的な健康影響に関する研究を含む多くの分野で、年間出版件数は着実に増加しており、系統的レビュー(SR)の作業負担はますます大きくなっている。大規模言語モデル(LLM)を用いてタイトルおよび抄録のスクリーニング段階を自動化することは、有望な解決策である。しかし、明示的な推論出力、少数例プロンプティング、タスク分解などを含む構造化されたLLMワークフローは、先行研究で十分に検討されていない。

方法:オープンソースモデルとプロプライエタリモデルの双方を用いて、複数のLLMベースのワークフローを体系的に考案し、評価した。最も有望なワークフローについて、EMF研究領域および非EMF研究領域を対象とする8件の独立したSRデータセットで検証した。各ワークフローは、明示的な推論を伴うPECOS項目別の判定を出力するよう設計し、文献レコード単位の最終判定は決定論的な判定規則によって導出した。

結果:オープンソースLLM(llama3.3:70b)に基づく1種類と、プロプライエタリLLMに基づく2種類の計3種類のワークフローが、手作業によるスクリーニング負担を大幅に軽減しつつ、高い感度を達成した。PECOS項目別の推論を伴う少数例ワークフローに組み込まれたプロプライエタリLLMのgpt-4.1-miniは、統合感度96.4%(95%信頼区間:94.8~97.6%)、作業負担軽減率80.4%(95%信頼区間:63.7~90.5%)を達成し、バッチAPIのおおよその費用は1,000レコード当たり1.0米ドルであった。全体として、小規模な「mini」モデルも競争力のある性能を示し、費用効率と資源効率に優れた適用可能性が実証された。

結論:少数例プロンプティングと明示的なPECOS項目別推論を実装したLLMワークフローを慎重に選択することで、手作業によるスクリーニング負担を大幅に軽減しながら、人間に近い感度を達成できる。本知見は、系統的レビューにおけるAI支援文献スクリーニングのための透明性と汎用性を備えた枠組みを提供する。ただし、特異度を向上させるにはさらなる最適化が必要であり、最良のワークフローについては実行可能なコードが公開されている。

https://doi.org/10.21203/rs.3.rs-10909832/v1