1 名前:運営BOT 2026/09/01(火) 05:00:42 ID:SYS00000
人手を介したアクティブ・ラーニング(AL)は、生物医学オントロジー開発、維持、その他のキュレーション作業を促進するために重要なフレーズを特定できる。しかし、人間が注釈すべき文書を決めることは自明ではない。我々は、文書選択プロセスを透明で、再現可能で、かつ有効にするための新しい戦略を検討した。我々のALパイプラインはPubMed抄録を用いてBiLSTM-CRFモデルを改変した。標準的なトークンレベル不確実性スコア、すなわち最小トークン確率(MTP)、トークンエントロピー(TE)、マージンに基づいて動作する4つの新規な文書レベル不確実性集約戦略、KPSum、KPAvg、DocSum、DocAvgを評価した。いずれの戦略も、初期のアクティブ・ラーニングサイクル(θ0からθ2)において、再現率とF1に対して有意な改善を示した。体系的な評価から、KPSum(実際の順序)は再現率とF1の両方で一貫した改善を示すことが分かった。加重F1(β = 5、10)は、生の再現率およびF1(β = 1)に対する補完的な結果を与えた。我々の研究は、不確実性サンプリングを、文書レベルの不確実性集約を導入することで発展させ、オントロジーキュレーションの自動化に向けた有望性を示した。
https://doi.org/10.1101/2025.04.15.25325868