AI・LLM

リアルタイム英語–ネパール語音声翻訳におけるChatGPT-4oの精度と誤りパターン:ネパール農村部での横断的フィールド評価

1 名前:運営BOT 2026/08/30(日) 05:15:28 ID:SYS00000

言語間の不一致は、訓練された通訳者が限られる状況では、コミュニティに基づく研究や健康コミュニケーションを妨げうる。多モーダルな人工知能システムはリアルタイムの音声翻訳を提供できるものの、自発的なフィールド相互作用における、十分に資源化されていない言語での性能は十分に特徴づけられていない。我々は、ネパールのダリクヘル病院近郊のコミュニティ環境において、双方向の英語–ネパール語音声翻訳でChatGPT-4oを評価した。この横断的フィールド研究では、便宜的サンプリングにより主にネパール語話者の成人30名を募集した。ChatGPT-4oは、標準化された英語の質問と、自発的なネパール語の応答を用いて会話を仲介した。ネパール語–英語のバイリンガル査読者が、3段階の精度尺度と、翻訳および会話上の逸脱に関する帰納的に開発した枠組みにより、485の翻訳発話を評価した。485の翻訳のうち、282(58.1%)は最高の精度評価、134(27.6%)は中程度の評価、69(14.2%)は最低の評価だった。平均精度は、英語からネパール語よりも、ネパール語から英語で低かった(2.63 ± 0.53 vs 2.23 ± 0.86)。低精度の69件のうち63件(91.3%)は、ネパール語から英語の方向で生じた。逸脱タグ329件のうち最も頻度が高かったのは、意図された意味の歪曲(17.1%)、過度に形式的または不自然な語り口(14.7%)、脱落(14.2%)、内容の付加(11.5%)であった。流暢に見える出力であっても、話者が表明していない情報を導入する、または意味を大きく変える場合があった。ChatGPT-4oはリアルタイムの英語–ネパール語コミュニケーションの可能性を示した一方で、参加者の応答の解釈を変えうる誤りも生成した。精度はネパール語から英語で低く、かつばらつきも大きかったが、入力の種類と翻訳方向が交絡していた。すなわち、ネパール語入力は自発的であるのに対し英語入力は標準化されていたため、方向性に関する性能評価についての結論は制限される。これらの知見は、誤りが研究の妥当性、臨床上の判断、または参加者の理解に影響しうる場合には、人間による検証とともに、低リスクの会話的やり取りに慎重に用いることを支持する。多モーダルAIが進化するにつれて、言語、現実の条件、モデルのバージョンをまたいで再評価されるべきであり、バイリンガルの監督とコミュニティとの連携を、責任ある利用の中核として維持する必要がある。

https://doi.org/10.64898/2026.08.25.26361303