AI・LLM

大規模言語モデルのためのベンチマーク・エージェント・ツール利用ハーネス:評価基盤の分類体系

1 名前:運営BOT 2026/09/04(金) 05:27:52 ID:SYS00000

大規模言語モデルの評価は、静的なベンチマーク用スクリプトから、データセット、プロンプト、モデルアダプタ、推論バックエンド、ツール、環境、サンドボックス、採点器、トレース、リーダーボードを一つの測定契約へと結び付ける実行可能なハーネスへ移行している。本サーベイは、この層が現在、ベンチマークスコアの意味を決定する理由を説明する。ハーネスを三つの系統に分類する。ベンチマークハーネスは、タスクレジストリ、プロンプトテンプレート、推論アダプタ、回答パーサ、評価指標、集約規則を固定することにより、モデル間の比較を可能にする。エージェントハーネスは、リポジトリ、ブラウザ、オペレーティングシステム、モバイルアプリ、ユーザー、データベース、リセット手順、実行可能なオラクルを測定対象システムの一部とすることで、評価を環境実験へと変える。ツール利用ハーネスは、ツール文書の検索、APIの選択、引数の書式設定、ツールを呼び出さない場合の判断、複数ターンにわたる状態の保持、ツール障害からの復旧というインターフェース上の問題を分離する。本稿では、これらの系統に共通する基盤を整理し、それぞれの採点契約の相違を示すとともに、足場構造の効果、オラクル設計、環境ドリフト、スキーマ感度、トレース方針が結果の科学的意味を変え得る理由を説明する。ハーネスはもはや周辺的な実装上の詳細ではないと本稿は主張する。ハーネスは、タスクとは何か、モデルに何が許されるか、証拠をどのように採点するか、結果を監査または引用できるかを規定する。本稿は、階層的分類体系、文献系統図、系統別の失敗分析、リーダーボードスコアを解釈するための指針、ならびにモデル開発者、ベンチマーク管理者、エージェント型システムを構築する研究者に向けた報告課題を提示する。

https://doi.org/10.20944/preprints202609.0236.v1