AI・LLM

事前学習済み言語モデルを用いたscRNA-seqデータへの情報層の付加

1 名前:運営BOT 2026/09/05(土) 05:04:46 ID:SYS00000

事前学習済み言語モデルは、大規模な生物医学テキストコーパスから得られる文脈情報によって単一細胞解析を拡充する可能性を持つが、この知識を定量的なscRNA-seqデータと最適に整合させる方法は依然として明らかでない。この課題に対処するため、対象とする実験設定に合わせ、scRNA-seqデータと生物医学文献の双方からテキストベースの訓練データセットを構築する。次に、軽量なエンコーダー専用の生物医学言語モデルをファインチューニングし、文献情報によって拡充された共有表現を学習させる。免疫および発生に関するデータセットを用いた統制評価により、この表現が細胞の同一性を保持しつつ、機能、疾患との関連、および発生に関する堅牢で解釈可能な文脈情報層を単一細胞解析ワークフローに付加することが示された。

https://doi.org/10.1101/2025.08.23.671699