目的:本研究は、ChatGPT-4o、Gemini-2.5 Flash、DeepSeek-V3が歯周病に関連する一般的な患者質問に対して生成した回答の正確性、質、理解しやすさ、実行可能性、および読みやすさを比較した。材料と方法:患者ベースの自由記述質問20件を各チャットボットに入力した。歯周病専門医2名が、科学的正確性、全体の質(GQS)、理解しやすさ、および実行可能性(PEMAT-P)について独立に評価し、読みやすさはAteşman Readability Indexで算出した。専門医が評価した領域における評価者間信頼性は良好から優れていた。結果:正確性または全体の質において、チャットボット間で有意差は認められなかった(p > 0.05)。一方で、理解しやすさ、実行可能性、および読みやすさでは有意差が認められた(p < 0.001)。ChatGPT-4oとDeepSeek-V3は理解しやすさが同等であり、Gemini-2.5 Flashより優れていた。対照的に、ChatGPT-4oとGemini-2.5 Flashは実行可能性が同等であり、DeepSeek-V3より優れていた。読みやすさでは、ChatGPT-4oが最も高いスコアを示し、次いでDeepSeek-V3、Gemini-2.5 Flashであった。結論:すべてのチャットボットは正確な回答を生成したが、コミュニケーション領域ごとの性能は異なっていた。ChatGPT-4oは、特に読みやすさと患者志向の明瞭性において、全体として最も良好なプロファイルを示した。しかし、いずれのモデルもすべての評価基準にわたって一様に優れているとはみなすべきではない。
https://doi.org/10.51122/neudentj.2026.201