科学エージェントは、回答の背後にある計算が実行可能、復旧可能、または再現可能であるかを確立できないまま、もっともらしい回答を生成し得る。本稿では、科学エージェントは自身に何ができるかを把握し、それをどのように行ったかを示し、何が未検証のままかを明示すべきである、という単純な原則に基づくAI4SワークステーションBloClawを提示する。各機能は、実行状態、入力制約、依存関係、期待される出力、科学的限界を宣言する。自然言語による要求は構造化タスクへ変換され、このレジストリに照らして検証され、科学ツールを通じて実行された後、来歴を考慮したLiving Lab Notebookに記録される。本システムは、無効な入力、ツール呼び出しの失敗、依存関係の欠落、リモート処理のタイムアウトを検出し、修復、再試行、またはエスカレーションへ振り分けるよう設計されている。実装および検証済みの範囲には、RDKitに基づく分子特性・規則スクリーニング、タンパク質構造解析、ドッキングポーズ検査、3次元可視化、構造化レポート作成が含まれる。PubChemから取得したオシメルチニブ構造と、提供された6LU7ドッキング成果物を用いてワークフローを実演した。前者からは決定論的な記述子(分子量499.619 Da、cLogP 4.5098、TPSA 87.55 Ų)が得られ、後者には2,387件のタンパク質ATOMレコード、309残基、9件のポーズレコードが含まれていた。これらはワークフローの実演であり、有効性や親和性の研究ではない。過去データに基づく予測にとどまらず、本稿では、所望の機能を明示的な物理的・化学的・システム的制約へコンパイルし、候補機構をシミュレーションし、観測結果を較正と反証のために再導入する、事前知識を最小化した構成的モードを規定する。ただし、これは提案された拡張であり、今回のケーススタディの成果ではない。タスク完了率、科学的正確性、復旧成功率、来歴の完全性、再現性、人間によるレビュー時間、レイテンシ、コストを用いて、BloClawを標準的な単一エージェント型ワークフローおよび固定スクリプト実行と比較する評価プロトコルについて述べる。本稿は、システム設計、検証済みの機能境界、決定論的なソフトウェア成果物、再現可能な評価プロトコルを報告するものであり、実験実施前にベンチマーク性能の向上を主張するものではない。BloClawはAI支援研究のための実行・説明責任レイヤーであり、専門家によるレビューや実験的検証を代替するのではなく、それらを補完する。
https://doi.org/10.64898/2026.08.26.747436