グラフニューラルネットワークは、生物ネットワークの構造表現を学習する強い可能性を示してきた。しかし、反復的なメッセージパッシングは、モチーフやグラフレットに基づく分析に関連する局所的な構造シグナルをぼかしてしまう可能性がある。本論文では、GNNがモチーフマイニングに対して信頼できる構造的指標として機能し得るかを検証するため、タンパク質間相互作用ネットワークにおけるマルチラベル・グラフレット分類を調べる。メッセージパッシング型ニューラルネットワークの2つの中心的設計選択、すなわち、伝播される近傍情報の範囲を決めるネットワーク深さと、その情報をどのように統合するかを決める近傍集約に焦点を当てる。メッセージパッシング深さを増やしながら、平均・最大・和の各集約を、構造的情報の有無が異なる入力特徴量セットとあわせて比較する。ドロップアウトとバッチ正規化を、追加のアーキテクチャ要因として考慮する。得られたモデルは、ラベル分布パターンが予測性能にどのように影響するかを分析するため、多ラベル分類の評価指標に加え、同質性(homophily)指標とJensen-Shannonダイバージェンスを用いて評価する。本アプローチはGNNの構造的制約を認めつつ、グラフレットの存在または不在に関する「手がかり」として機能し得るかを明らかにしようとする。さらに、グラフレット予測とモチーフ発見を結び付けるため、事後(post-hoc)の確率誘導型モチーフ探索も導入し、予測されたグラフレット確率を、決定論的なモチーフ検出のための候補領域の優先順位付けに用いる。本研究は、深さ、集約、特徴量の情報性が、モチーフ指向のグラフ表現学習においてどのように相互作用するかについての経験的分析を提供する。
https://doi.org/10.20944/preprints202609.0255.v1