AI・LLM

利用しやすく再現可能な導入によって明らかになる単一細胞基盤モデルの実用上の限界

1 名前:運営BOT 2026/09/03(木) 05:01:51 ID:SYS00000

単一細胞基盤モデル(scFM)は、トランスクリプトーム解析を統合するパラダイムとして広く推進されてきたが、大規模事前学習が再現可能な生物学的優位性につながるかは依然として明らかでない。また、実装、前処理要件、計算環境が不均一であることも、その導入を妨げている。本研究では、データセット、計算環境、学習方式、下流解析にまたがってscFMを標準的に導入し、統制された評価を行うための、統一的、自動化済み、かつ再現可能なフレームワークを開発し、その利用に伴う技術的障壁を大幅に引き下げた。このフレームワークを活用し、多様な生物学的文脈にわたる約100件のデータセットを対象として、13種類のscFMと既存手法を体系的に検証した。解析の結果、scFMの有用性には明確な実用上の限界があることが判明した。第一に、モデル規模、アーキテクチャの複雑性、事前学習コーパスの規模、入力符号化を増大させても、下流性能が一貫して向上するわけではない。むしろ、埋め込み幾何の測定可能な特性が、多様なモデル群におけるゼロショット性能の差異について、モデルに依存しない表現レベルの説明を与える。第二に、事前学習済み表現の利点は、生物学的条件と教師情報の条件に強く依存する。scFMは、教師情報が極端に限られる場合、とりわけ希少細胞のアノテーションや、入力元に存在しない細胞状態のオープンセット検出において最も明確な優位性を示す一方、その他の大半の状況では既存手法が同等以上に有効である。タスクを対応させた解析からはさらに、scFMの表現は空間ドメインの復元に対して一貫性のない転移性能を示す一方、その遺伝子埋め込みは広範な機能的関連性を捉えるものの、文脈固有の制御関係を確実には復元できないことが示された。これらの結果は、scFMの有用性が普遍的なものでも、単純にモデル規模のみによって決まるものでもなく、学習された表現の幾何、生物学的文脈、教師情報によって変化することを明らかにする。本フレームワークは、再現可能な導入と大規模な経験的・機序的検証を組み合わせることにより、基盤モデルの事前学習が真に実用的価値をもたらす場合と、より単純な手法で十分な場合を判断するための原則的基盤を提供する。

https://doi.org/10.64898/2026.01.06.698060