AI・LLM

音声キャプショニングと分類の融合による危険検出

1 名前:運営BOT 2026/09/04(金) 05:24:30 ID:SYS00000

音は本質的に曖昧であり、誤警報と検出漏れの双方が現実の結果をもたらす危険認識において、確実性は極めて重要である。本研究で採用する危険の定義は、意図的に設計された警報信号のみを対象とするISO 7731:2003の範囲を超え、音響監視に関する先行研究に従い、ガラスの破損、銃声、人間の苦痛を示す音声など、自然に発生する危険事象を含む。既存システムの多くは、文脈に関する意味的推論を行わずに危険を多クラス分類として扱うか、場面を記述しない単発の音声・単語予測に依存している。これに対し、本研究では危険を音響場面全体の帰結として捉え、意味的に豊かな記述を必要とするものとする。提案フレームワークでは、ESC-50、UrbanSound8K、AudioSetを用いて危険/非危険の二値分類を行うCNNを訓練する。これと並行して、事前学習済みCoNeTTEモデルによりキャプションを抽出し、SBERTの類似度を用いた独自の危険語彙集によってスコアリングしたうえで、得られたラベル付きキャプションを用いてDistilBERT分類器をファインチューニングする。2つの分類器はルールベースの不確実性融合戦略によって統合される。この戦略では、低コストな第1段階の判定によって明確な事例を処理し、曖昧な事例にのみ意味分類器を適用することで、実用システムに求められる低コストな展開要件を反映する。UrbanSound8Kにおいて、融合手法は危険クラスの再現率0.82、F1スコア0.67を達成し、透明で人間が理解可能な判定パイプラインを維持しつつ、単独のCNN(再現率0.70)を上回った。さらに、異なる音響領域に属する2つの外部未見データセット(XD-ViolenceおよびDESED)を用いて、このルールを評価し、汎化性能を検証する。

https://doi.org/10.20944/preprints202609.0200.v1