AI・LLM

MitoSeqGen:哺乳類ミトコンドリアmRNAのコドン最適化に向けた制約付き生成Transformer

1 名前:運営BOT 2026/09/04(金) 05:30:52 ID:SYS00000

要旨 動機:既存のコドン配列最適化AIモデルは、ほぼ例外なく標準核遺伝暗号に基づいて学習されている。哺乳類のミトコンドリア遺伝子は、4つのコドンが再割り当てされた独自の遺伝暗号(NCBI翻訳表2)を使用する。ミトコンドリア機能障害はコドン最適化配列を必要とする遺伝子治療の標的として広く認識されているにもかかわらず、この遺伝暗号向けに構築または評価されたコドン最適化モデルは存在しない。結果:NCBI Entrezから4,134種の脊椎動物に由来する100,250件のミトコンドリア配列を収集し、重複除去後に46,264件の固有配列を得た。データ漏洩を防ぐため、種単位でデータを分割した。2,520万パラメータのエンコーダー・デコーダー型Transformerをゼロから学習し、制約付き自己回帰デコーディングによって候補コドンをミトコンドリア遺伝暗号における同義コドン集合に限定した。これにより、内部終止コドンを一切生じさせず、構造上100%のタンパク質正確性を保証した。保留した5,155件のテストタンパク質において、本モデルはミトコンドリア遺伝暗号に準拠した4種のベースラインよりも、天然配列に対するBLEU-4類似度が有意に高かった(0.313対0.075~0.171、対応のあるWilcoxon検定でp < 10^-300)。汎用最適化器として最先端のCodonTransformerを適応なしで適用したところ、出力の93.4%に早期終止コドンが生じ、5,155件中、正しく翻訳されたものは0件であった。CodonTransformerを本研究のミトコンドリアコーパスでファインチューニングすると、タンパク質正確性は完全に回復した(5,155件中0件から5,155件中5,155件)。しかし、コドン選択の類似度では本モデルに及ばなかった(BLEU-4:0.244対0.313)。GC含量の偏差は同等であったが、RNA二次構造の最小自由エネルギー(MFE)の偏差ではCodonTransformerが優れており、これは大規模な事前学習を反映している可能性が高い。さらに否定的結果として、GC含量と構造に残る差を縮小するための3種類の学習損失介入はいずれも、これらの指標を改善しなかった。入手可能性:コード、整備済みデータセット、学習済みモデルの重みはMITライセンスで公開されている。連絡先:

https://doi.org/10.21203/rs.3.rs-10901669/v1