Skillを能力の証明ではなく、ワークフロー設計として扱う

Skillは、エージェントの判断、コマンド、ファイル変更、外部へのリクエストに影響を与える可能性があります。単にプロンプトに追加するドキュメントではなく、提案された運用手順としてレビューしてください。中心となる問いは、その指示、ツール、証拠の扱いが、許可しようとしている化学タスクに適しているかどうかです。

Scientific Agent Skills repository は、科学系パッケージ、データベース、研究ワークフローに関するガイダンスを提供しています。文書に記載された化学分野の対象には、RDKit、PyTDC、分子ドッキング、ADMET解析、校正済み1D NMR処理、結晶構造解析が含まれます。これらは情報源に記載されたワークフローであり、すべての手順があなたの環境で機能する証拠ではありません。

このガイドは、レビューと評価のプロセスを提案するものです。このコレクションをインストール、実行、あるいは実際に科学的テストしたと報告するものではありません。

1つのタスクを選び、指示全体を確認する

指定した分子記述子の計算や、定義した化合物リストのデータベースレコードの取得など、範囲を限定したタスクから始めます。いずれ複数のワークフローが役立つかもしれないという理由だけで、コレクション全体を有効にしないでください。

リポジトリの説明によると、各skillには用途、ワークフロー、バージョンメタデータを記載した SKILL.md があります。補助資料には、例、参考資料、実行可能なヘルパー、テンプレートが含まれる場合があります。主な指示だけでなく、これらの資産も確認してください。

  1. 想定する入力、必要な出力、禁止する操作を書き出します。
  2. 選んだskillの指示を最初から最後まで読みます。
  3. エージェントが使用する可能性のあるスクリプトやテンプレートへの参照をたどります。
  4. パッケージのインストール、ファイルへの書き込み、サービスへの接続、認証情報を必要とする操作に印を付けます。
  5. 手順のどこで科学的判断や人間の承認が必要になるかを特定します。

**判断のための問い:**このワークフローはタスクに直接対応していますか?無関係な操作を除外できますか?前提条件が不足している場合に停止しますか、それともエージェントに独自のやり方を促しますか?

skillファイル、依存関係、アクセス権を区別する

指示をインストールしても、基盤となる科学ソフトウェア、データセット、サービスへのアクセスが提供されるわけではありません。リポジトリはskillのインストールと依存関係のインストールを明確に区別し、要件に互換性のないワークフローには別々の環境を推奨しています。

選んだ手順について、前提条件の一覧を作成します。

  • 科学系パッケージと、文書に記載された互換性上の制約。
  • システムツールと計算リソース。
  • 入力データセット、形式、必須メタデータ。
  • 外部エンドポイント、アクセス条件、認証情報。
  • 書き込み可能なディレクトリと想定される出力ファイル。

情報源に記載されたDatabase Lookupのガイダンスは、PubChemやChEMBLを含め、エンドポイントの選択、ページネーション、アクセス要件、出典と処理履歴を扱っています。これらのデータベースは独立したリソースです。skillに含まれているからといって、すべてのレコードやサービスにアクセスできるとは限りません。

ホストの対応状況も別途確認が必要です。リポジトリはAgent Skillsのパッケージ形式と、plugin.json および skills/ を使用するAgent Pluginsの構成を説明していますが、検出パスや任意メタデータの処理方法はホストによって異なります。ホスト名や形式がドキュメントに記載されていることは、互換性テストに成功したことを意味しません。

先に進む前に、ソフトウェア、重み、データの権限を個別に確認してください。指示のコレクションだけから上流の権限を推測しないでください。

証拠を保持する出力仕様を定める

化学ワークフローでは、すべての変換を通じて分子の同一性、出典レコード、観測結果を保持する必要があります。エージェントを評価する前に出力を定義し、整った説明で証拠の欠落を覆い隠せないようにします。

分子レコードを扱うワークフローでは、提案する出力仕様に、元の入力識別子、送信した構造、解析状態、取得した出典識別子、変換に関する注記、計算値を含めることが考えられます。該当する場合は、単位と計算の定義も記録します。文献調査では、出典リンクまたは識別子を保持し、取得した記述とエージェントの解釈を区別します。

失敗時の動作を明示的に定めます。無効な構造、曖昧な一致、利用できないレコード、欠損値を黙って破棄したり、推測で補ったりせず、見える状態に保ちます。構造を標準化する場合は、元の表現を残し、適用した方針を説明します。

**判断のための問い:**各結果を入力までたどれますか?計算量と出典で報告された観測結果は分けられていますか?不完全な証拠を確信に満ちた結論に変えるのではなく、不確実性を保持していますか?

コマンド、ファイル、ネットワークサービスを制限する

初回の評価では、機密性のない入力を使用する、権限を限定した環境を使います。選んだタスクに必要なファイルの場所、サービス、認証情報だけを許可します。特に、インストール内容の変更、破壊的な操作、アップロードなど、境界を越える操作には承認を必須とします。

ヘルパーを実行する前に、実際のソースを確認します。ファイル名や例の説明を頼りにせず、入力の前提、出力先、エラー処理を確認してください。

リポジトリはセキュリティスキャンとレビューの実践を説明していますが、リスクを網羅的にレビューできる保証はないとも警告しています。スキャンは補助的な証拠であり、skillがエージェントに何をさせようとしているのか理解する代わりにはなりません。ダウンロードしたレコードや文書はデータとして扱い、ワークフローの権限を拡張する権威として扱わないでください。

計画例:記述子の計算とレコード検索

**仮定のシナリオ:**化学チームが、機密性のないSMILES 12件についてエージェントに指定したRDKit記述子を計算させ、その後、関連するPubChemレコードを取得させたいとします。これは文書化されたパッケージとデータベースのガイダンスを組み合わせた提案であり、テスト済みの連携ではありません。

**入力:**各行にローカル化合物IDと元のSMILESを含む表。前提や処理上の仮定を明らかにするため、重複、無効な文字列、電荷を持つ構造を含めます。

**提案する出力:**入力ごとに1行のステータスを作成し、元のIDとSMILESを保持します。解析状態、変換後の表現があればその値、要求した記述子、出典識別子、取得元と処理履歴、エラーの注記を含めます。結果がない場合は、明示的に欠損として残します。

評価は段階的に計画します。

  1. 関連するRDKitおよびDatabase Lookupの指示と参照資産を確認します。
  2. 記述子の定義と構造処理方針を定めます。
  3. ローカル計算とネットワーク検索を別々に評価します。
  4. 同じ定義と環境を使い、計算結果を人間が管理する直接的なベースラインと比較します。
  5. エージェントにデータベースの一致結果を要約させる前に、それらを確認します。

適切な受け入れ基準案として、すべての入力が記録され、無効な入力にフラグが付き、裏付けのない同一性の一致を無理に成立させないことが挙げられます。記述子の値やデータベースの一致結果だけから、生物活性や安全性について主張してはいけません。

手順を評価し、その限界を記録する

エージェントのホスト、モデル、skillのリビジョン、パッケージのバージョン、入力の出典と処理履歴、権限、人間による修正を記録します。化学AIワークフローの再現性を保つための原則に従ってください。

リポジトリは、構造チェック、科学系依存関係のテスト、実サービスのチェックを区別しています。これらが示す証拠はそれぞれ異なります。構造上有効なskillが科学的に正しいとは限らず、ローカルテストでリモートサービスの信頼性が確立されるわけでもありません。成功した例が裏付けるのは、評価した構成と事例に限られます。より広い科学的主張には、別個の研究が必要です。

簡易レビューチェックリスト

  • タスク、入力、出力、禁止する操作を定義する。
  • SKILL.md と関連する補助資産をすべて確認する。
  • 依存関係、アクセス条件、ホストの検出動作を確認する。
  • 権限を制限し、機密性のないデータから始める。
  • 追跡可能な出力と、失敗の明示を必須にする。
  • ベースラインと比較し、エッジケースを確認する。
  • より広範な利用を許可する前に、制約を記録する。