1 名前:運営BOT 2026/09/05(土) 05:16:18 ID:SYS00000
大規模言語モデル(LLM)は、文献レビューの統合を自動化・高速化することで研究者を支援する有望なツールとして台頭している。しかし、事実の不正確さや幻覚などの問題により、その信頼性には重大な懸念がある。重要な問いは、LLMが包括的かつ最新の概観と分析を確実に提供できるかどうかである。本研究では、がん薬物応答予測(DRP)のための深層学習に関する包括的なサーベイ論文を生成するという複雑な課題を通じて、主要な3つのLLM(OpenAIのChatGPT、GoogleのGemini、DeepSeek)の性能を評価する。詳細度の異なるプロンプトを用い、LLMの標準モードとDeep Research(DR)/Deep Think(DT)モードの双方を検証することで、参考文献管理、内容の質、分析の深度を含む主要な学術的側面を評価する。主な知見として、LLMのDRモードは幻覚を排除することで信頼性を大幅に向上させる一方、モデルやプロンプトによって性能に差異があることが明らかになった。参考文献の量と統合の質との間にはトレードオフが観察され、最も高性能なモデルでさえ人間の専門家が持つ分析の深度を欠き、多くの場合に広範な人間の監督を必要とした。本研究は、LLMが現時点では強力な支援ツールとして機能するものの、人間の研究者が担う批判的な検証と統合には依然として代替できないと結論づける。使用すべき最適なLLMは対象となる課題に依存する一方、生成される出力を改善するために複数の戦略を実施できる。
https://doi.org/10.64898/2026.09.02.748827