AI・LLM

遺伝的構造と標本サイズが非線形機械学習と標準的な多遺伝子リスクスコアの相対性能に及ぼす影響

1 名前:運営BOT 2026/09/05(土) 05:39:11 ID:SYS00000

標準的な多遺伝子リスクスコア(PRS)は、相加的なゲノムワイド関連解析(GWAS)の要約統計量に基づいて構築される。非相加的な遺伝効果をモデル化する能力により標準PRSを上回る予測性能を得ることを目的として、個人レベルのデータからPRSを直接構築する非線形機械学習手法がますます利用されている。しかし、研究間でその優位性は一貫しておらず、どのような条件下で有意な改善をもたらすのかは明らかでない。本研究では、理論解析、シミュレーション、実データへの応用を組み合わせ、広く用いられる2つの非線形機械学習手法であるランダムフォレストとXGBoostが標準PRSを上回る条件を検討した。理論解析の結果、標準PRSは、周辺的な一塩基多型(SNP)効果への寄与を通じて、非相加的な遺伝効果に由来する遺伝分散の一部を暗黙的に捉えられるため、一般に想定されるほど多くの情報を失わないことが示された。非線形モデルは理論上より高い可能性を有するものの、その柔軟性の高さはバイアスと分散のトレードオフをもたらし、有限の標本サイズでは予測性能の向上を制限し得る。シミュレーションでは、比較的少数の交互作用効果に集中した交互作用遺伝分散が十分に大きな割合を占め、かつ大規模な訓練標本が利用可能な場合にのみ、XGBoostが標準PRSを上回った。ランダムフォレストは一貫して標準PRSを下回った。UKバイオバンクのデータを用いた虚血性心疾患予測への応用では、XGBoostは標準PRSと比べて予測性能に有意義な改善を示さず、ランダムフォレストはここでもより低い性能を示した。以上の知見は、非線形機械学習が標準PRSを一様に上回るわけではなく、その相対的性能が遺伝的構造と訓練標本サイズの双方に依存することを示唆する。本研究は、先行研究で報告された一貫しない結果の整合的な理解に寄与し、より複雑なPRSモデルが有益となり得る状況を特定するための枠組みを提供する。

https://doi.org/10.64898/2026.08.29.26361109