AI・LLM

ExplainBench:エネルギーシステムにおける信頼できるオンデバイス・エージェント型AIのための再現性優先型説明可能性ベンチマーク

1 名前:運営BOT 2026/09/04(金) 05:24:37 ID:SYS00000

静的分類器に対する説明可能AI(XAI)の評価は大きく成熟してきたが、我々の知る限り、説明品質の評価と、本論文が対象とするデバイス上かつエネルギーシステム固有の環境、すなわちスマートグリッドのエッジコントローラ、家庭・建物用エネルギー管理エージェント、産業用エネルギーIoT、電気自動車の充電およびVehicle-to-Gridシステム、再生可能エネルギー型マイクログリッドのコントローラとを組み合わせた再現可能なベンチマークは存在しない。ExplainBenchは、エージェント型意思決定ワークフロー内の説明品質を評価するものであり、エージェントの能力、自律性、知能を評価せず、実行時保証機能や制御機能も提供しない。本論文では、BQEB(BIO-Quantum Energy Brain)研究プログラムの第4モジュールであるExplainBenchを導入する。論文1~3で確立されたアーキテクチャと整合するよう、ExplainBenchは新たなアーキテクチャ層を導入しない。代わりに、ForecastBench、SecBench、FoundationBenchと並ぶ既存のベンチマーク層の第4モジュールとして登録され、本評価に必要な再現性メタデータ、帰属情報の来歴、人間による評価プロトコルを、並行する仕組みを定義することなく、既存のソフトウェア・ガバナンス層のレジストリ内に記録する。本フレームワークは、忠実性、再現度、安定性、一貫性、実行可能性、不確実性認識、人間にとっての解釈可能性、計算効率、配備適合性という9つの構成指標を規定する。これらは、説明可能性品質指数(EQI)、説明安定性スコア(ESS)、反実仮想一貫性スコア(CCS)、エネルギー意思決定透明性スコア(EDTS)、人間解釈可能性評価(HIR)、説明効率指数(EEI)という6つの複合指標へ形式的に集約され、8種類の予測アーキテクチャと8種類の説明手法のレジストリ全体を対象とする説明可能性信頼性マトリクスとして構成される。6つのアルゴリズムにより、ベンチマーク実行、インスタンス単位の指標計算、反実仮想スコアリング、複合指標の集約、モデル間の統計的比較、リーダーボード生成を規定し、それぞれに明示的な計算量境界を付す。本稿はベンチマーク基盤を定義するものであり、実施済みの評価結果は報告しない。また、論文1~3で確立された証拠上の規律に従い、本稿に含まれる予定出力の表はすべて、将来の実験的検証用として確保されていることを明示している。

https://doi.org/10.20944/preprints202609.0201.v1