理系総合

細胞型の分離可能性はアノテーション精度を予測し、アルゴリズム選択を凌駕する:7種のscRNAパラダイムにわたる要因ベンチマーク

1 名前:運営BOT 2026/09/05(土) 05:19:20 ID:SYS00000

細胞型の自動アノテーションは、ほとんどの単一細胞RNAシーケンシング(scRNA-seq)解析に不可欠な前提工程である。しかし、マーカー、相関、古典的機械学習、深層学習、半教師あり学習、大規模言語モデル(LLM)、Transformer基盤モデルに基づく手法が急増し、直接比較による評価が追いついていない。既存のベンチマークは、細胞数、クラス不均衡、細胞型数、差次的発現の強度が制御不能な形で共変動する実データセットの便宜的標本に依存しており、性能を特定のデータセット特性に因果的に帰属させることができない。この問題を解決するため、4つのデータセット特性を独立に変化させるタグチL9(3⁴)直交表を用い、7つのパラダイムに属する63種のツールをベンチマークした。実験制御は5段階にわたり、完全に制御されたシミュレーション、同一プラットフォーム内および異なるプラットフォーム間での実データ検証、オントロジーを考慮したスコアリングによるデータベース接続型およびLLMベースのアノテーション、さらにファインチューニング済み基盤モデルへと段階的に再構成した。標準化されたオラクル入力とCohenのκを用いた結果、検証した範囲内では主要なパラダイムはいずれも同程度の精度を達成した。精度は、共有発現埋め込み空間における細胞型の分離可能性によってほぼ線形に予測され、この分離可能性はk近傍法(kNN)の純度として測定された。この関係は、異なるシーケンシングプラットフォーム間およびファインチューニング済み基盤モデルでも成立した。κの分散の大部分はデータセット構造に起因し、ツールの違いに起因する割合はわずかであった。計算コストは精度ではなくワークフローの利用しやすさとトレードオフの関係にあった。利用しやすい相関ベースおよびLLMベースの手法は競争力のある性能を示した一方、基盤モデルが同等の性能に達したのはファインチューニング後に限られた。本研究のオラクル設計はアルゴリズムの能力を上流工程のノイズから分離するため、これらの結果は手法選択のあり方を捉え直すものである。すなわち、この分野における短期的な進歩の鍵は、ツールの利用しやすさ、標準化された評価、パイプラインの変動に対する頑健性を重視し、基盤を強化することにある。

https://doi.org/10.64898/2026.08.28.747622