要旨 コミュニティ型メッセージングプラットフォームにおける危険なやり取りは、持続的な接触、返信の集中、リンクの反復共有、対立の激化、集団力学の混乱を通じて発展することが多く、個別のメッセージ、キーワード、またはノイズの多い通報だけを用いたスレッド単位の検出は困難である。本研究では、異常なスレッド内相互作用を検出し、信頼できる否定的フィードバックを予測するための、弱教師ありかつプライバシー保護型のフレームワークRiskThread-LFを提案する。データセットは、4,860万件のメッセージイベント、620万件のスレッド、112万のコミュニティ、2,740万件の匿名相互作用エッジ、310万件の管理者対応、96万件の通報、48万件のメンバー退出イベントを含む。高リスクのスレッドでは、接触の集中、反復的な拡散、対立する返信の伝播、または関係性の混乱が見られ、その後、削除、ミュート、警告、スレッド制限、通報後の介入、メンバーの退出、短期的な離脱などの信頼できるシグナルが生じる。一方、通常の通報は正解データではなく、弱いシグナルとして扱われる。RiskThread-LFは、通報、管理者対応、反復的な伝播、異常な返信集中、メンバーの退出、コミュニティの過去のベンチマークを統合し、さらに通報バイアス補正によって通報確率と異常伝播リスクを分離する。本モデルはAUC=0.891、Macro-F1=0.817を達成し、キーワード規則、高性能なコンテンツ安全性分類器、長文脈Transformer、時系列グラフモデル、LLMによるモデレーションを上回った。早期警告のAUPRCは0.734に達し、信頼できる否定的フィードバックに平均12.4分先行した。弱ラベル統合を除去するとMacro-F1は0.052低下し、通報バイアス補正を除去すると通報活動が非常に活発なコミュニティにおける偽陽性率が0.061上昇した。差分プライバシー(ε=3.0)の下でもAUCは0.862を維持し、メンバーシップ推論の成功率は0.214から0.128に低下した。これらの結果は、信頼性の高いコミュニティリスク検出には、テキスト、キーワード、または通報数だけではなく、スレッドの行動、弱いフィードバック、通報バイアスを統合的にモデル化する必要があることを示している。CCS概念:計算方法論~機械学習~学習設定~半教師あり学習設定
https://doi.org/10.21203/rs.3.rs-10901054/v1