AI・LLM

人口ベースのがん登録に適用した事前学習済みTransformerは、ラベル不足および未知のがんにおける生存予測を改善する

1 名前:運営BOT 2026/09/05(土) 05:50:20 ID:SYS00000

腫瘍学における予後モデルは、がん種ごとに当該がんのラベル付き転帰を用いて開発されており、予後情報が最も乏しい場面では機能しない。希少がんは診断のおよそ5分の1と小児悪性腫瘍の大半を占めるが、信頼できるイベント発生時間モデルに十分なイベント数を確保できることはまれである。そこで、転帰ラベルなしで学習した表現が、こうしたコホートに欠けている情報を補えるかを検討した。2000年から2023年に診断され、SEER 17登録に収載された9,425,135件の腫瘍記録に対し、フィールド値のマスクモデリングによってTransformerエンコーダを事前学習した。フェイルクローズ方式のコーディング検証ゲートを通過した診断時フィールドのみを採用し、各記録を時代別ビューと調和済みビューとして出力することで、20年間にわたる再コーディングの監査可能性を維持した。その後、エンコーダを凍結し、全生存期間を予測する線形Coxヘッドから参照した。9種類の希少がんを事前学習コーパスから完全に除外し、それぞれについて独立した事前学習を実施した。封印されたテスト用パーティションでは、9種類すべてにおいて、Harrellの一致指数が同一アーキテクチャのランダムな凍結エンコーダを+0.0034から+0.0368上回り、すべての信頼区間下限がゼロを上回った。ラベル付き患者が256人の場合、67種類すべてのがんで、事前学習済み表現が同一予算のCox回帰より優れ、差の中央値は+0.0283であった。ただし、この優位性には限界があり、訓練セット全体を与えた場合、9種類の希少がんのうち7種類ではCox回帰が優位であった。エンコーダは自身の目的においてフィールド頻度ベースラインを上回らなかったため、上流の再構成性能は下流の転移性能を予測しなかった。転帰に依存しないレジストリ事前学習は、未知のがんにも予後情報を移転し、ラベルが最も少ない場合に最も有用であるが、臨床的有用性を確立するものではない。

https://doi.org/10.64898/2026.08.30.26361693