科学向け Skill が行うこと、行わないこと

科学向け Skill は、収集する入力、使用するソフトウェア、実施する確認事項、停止するタイミングなど、アシスタントに手順上の指示を与えます。補助ツールも同梱するリソースがあります。これらの指示を読み込んでも、依存関係がインストールされたり、実験データが提供されたり、科学的妥当性が確立されたりするわけではありません。Skills のホスト側の対応状況はさまざまであるため、指示の検出と実行権限を別々に確認する必要があります。

この10種のリソースは、ケモインフォマティクスの選択肢3種、分光ワークフロー1種、材料系リソース3種、熱力学/速度論ワークフロー2種、反応分子動力学解析リソース1種を扱います。それぞれの役割は相互に置き換えられません。ASE ルーターは委任の準備を行う一方、Cantera のヘルパーは別途インストールされたソフトウェアを通じて、対象を限定した計算を実行します。

より広い区別については、エージェントと Skills、MCP、Skills、エージェント、API、化学 AI スタックを参照してください。化学エージェント Skills のレビューでは、補完的な評価の視点を紹介しています。

関連ガイド:化学の AI Skills · 材料科学の AI ワークフロー。

役割とデータ契約から10種のリソースを比較

表中の K-Dense は scientific-agent-skills コレクション、CCAS は computational-chemistry-agent-skills を指します。ライセンス表示は Skill または提供されるコレクションのコードに関するものであり、依存関係、データベース、出力に自動的に適用されるわけではありません。

Skill とコレクション 指示/ヘルパーの役割、上流ソフトウェアと依存関係 入力 → 想定出力 ライセンスの適用範囲または未解決事項
RDKit Skill、K-Dense 詳細な分子ガイダンスと Python ヘルパー3種。rdkit のインストールが必要 SMILES/SDF/MOL/InChI → 記述子、フィンガープリント、マッチ、変換、座標 Skill は BSD-3-Clause、コレクションは MIT を宣言。適用範囲は未解決
Datamol Skill、K-Dense ワークフロー指示と参照資料。Datamol は RDKit をラップし、ネイティブ分子オブジェクトを返す 分子文字列/ファイル → 前処理済み分子、記述子テーブル、クラスタ、骨格、配座 Skill は Apache-2.0、コレクションは MIT を宣言。適用範囲は未解決
rdkit-agent Skill、scottmreed/rdkit-agent 独立した RDKit WASM CLI を使うための指示。MCP および Node.js インターフェースが文書化されている 化学表記/JSON コレクション → 検証、変換、記述子、検索 提供されたライセンス根拠なし
nmrglue Skill、K-Dense 指示と校正済み 1D 処理ヘルパー。nmrglue、NumPy、SciPy 複素 FID と取得パラメータ/設定 → spectrum.csv、report.json Skill/コレクションコードは MIT。取得データは別扱い
Pymatgen Skill、K-Dense 材料向け指示とローカルヘルパー。pymatgen、任意の mp-api クライアント 構造、組成、エネルギーエントリー、クエリ条件 → 検証、変換、凸包解析、クエリ計画 Skill は MIT。外部ソフトウェアとデータの条件は別扱い
ASE Skill、CCAS トップレベルのルーターのみ。Python と ASE、任意の GPAW/MACE アダプター タスクの意図/コンテキスト → 分岐、理由、不足入力、次の委任先 Skill は MIT を宣言。コレクションには LGPL v3 の文面がある。適用範囲は未解決
Phonopy Skill、CCAS 変位/解析の指示。phonopy と別途用意する力計算プロバイダー 構造/設定および変位セルの力または力定数 → 組み立て状況、フォノン分散/DOS/熱力学ファイル Skill は LGPL-3.0-or-later を宣言。力計算プロバイダーは別扱い
Cantera Skill、K-Dense 指示と均一着火ヘルパー。Cantera と NumPy 反応機構、初期状態、反応器の制約、数値設定 → JSON、4組の時系列、反応機構スナップショット Skill/コレクションコードは MIT。反応機構の権利は別扱い
pycalphad Skill、K-Dense 指示とローカル平衡ヘルパー。pycalphad と NumPy TDB と組成/相/条件の設定 → report.json、phase-equilibria.csv Skill/コレクションコードは MIT。TDB の権利は別扱い
ReacNetGenerator Skill、CCAS 反応 MD ツール選択の指示。ReacNetGenerator、別個の reacnet-md-tools ラッパー、uv/python3 軌跡、原子マッピング、セルのコンテキスト → 化学種・反応の解析成果物、レポート、ログ Skill は LGPL-3.0-or-later を宣言。パッケージと軌跡は別扱い

どのケモインフォマティクス経路を選ぶべきか?

日常的な分子前処理、記述子計算、骨格によるグループ化、多様性選択には Datamol の指示を選びます。明示的なサニタイズ判断、詳細な分子操作、特殊アルゴリズムが必要な場合は RDKit の指示を選びます。この違いはインターフェースと制御の違いであり、どちらかがより優れた科学的結果を生むという根拠を示すものではありません。

構造化された CLI とのやり取りがホストに適している場合は、rdkit-agent の指示を選びます。その指示では、overall_pass の確認、修復提案の精査、返却フィールドやマッチ数の上限設定を重視します。実行可能な操作と MCP サーバー機能を提供するのは Skill ではなく基盤パッケージです。文書化された MCP モードが、現在のすべてのホストとの互換性を保証するわけではありません。標準 WASM では立体異性体の列挙が明示的にサポートされていません。

3つの経路すべてで、化学的意味を扱う方針が必要です。塩除去、中和、立体化学の変更より前に、元の構造と識別子を保持します。Canonical SMILES は互変異性体を統一せず、pH 依存のプロトン化状態も確立しません。フィンガープリントの類似度は分子の同一性ではなく、記述子の閾値は活性や安全性の予測ではありません。RDKit の pains という名前のヘルパーオプションに含まれるのは例示的なモチーフであり、公開済みの PAINS カタログではありません。

分子ライブラリの評価案

提案する例であり、テスト済みの統合ではありません: source_id と smiles を持つ小規模な CSV を使い、通常の取り込みには Datamol、例外の診断には RDKit を評価します。例として、エタノール(CCO)、ベンゼン(c1ccccc1)、荷電塩([Na+].[Cl-])、立体化学が未指定の分子、意図的に不完全な環文字列(C1CC)を含めます。

  1. **取り込み:**すべての元データ行を保持します。失敗を黙って削除せず、受理レコードと拒否レコードの表を作成します。
  2. **方針の決定:**塩と電荷が対象とする化学種を表しているか判断します。この評価では、変換を明示的に正当化できない限り保持します。
  3. **解析:**選択した記述子と、記録した1種類のフィンガープリントスキーマを計算します。識別子、変換後の表現があればそれも、設定、失敗理由を出力します。
  4. **確認:**拒否後も識別子の対応関係が保たれているか検証します。修復が行われた場合は内容を精査し、元の化合物として扱わないようにします。
  5. **規模の判断:**全件のペアワイズクラスタリングを行う前に、メモリ使用量を評価します。Datamol の指示では、ペアワイズ距離が利用可能なメモリを超える可能性が警告されています。必要に応じて、代わりに範囲を限定した多様性選択を評価します。

下流モデルや DrugAgent に成果物を渡すことは、相互運用性が確立されているという意味ではなく、提案する利用方法です。まずスキーマと来歴要件を定義します。ラベルを追加する場合は、学習ベースの前処理より前に骨格/グループ分割を評価します。これらの Skills 自体は予測モデルを提供しません。RDKit AI ワークフローも参照してください。

分光処理と同定を分ける

nmrglue ヘルパーは、均一サンプリングされた複素 1D FID を対象としています。受け付ける入力は、.npz 内の単一の複素 fid 配列、または標準的な複素時間領域 NMRPipe ファイルです。取得パラメータと手動の位相設定を明示する必要があります。

判断の関門となるのは取得データの根拠です。スペクトル幅、観測周波数、キャリア位置、複素信号の符号規約を推測ではなく確認する必要があります。NMRPipe の校正メタデータに矛盾がある場合は取り込みを停止します。実験装置のデータをデコードするには別途確認が必要であり、変換済みファイルを開けたからといって元データのデコードが正しかったことにはなりません。

信号のないベースライン領域や積分窓を選ぶ前に、実部と虚部のスペクトルを確認します。出力は正のピーク候補と符号付き積分であり、帰属や化合物同定ではありません。負の面積も診断情報として残します。ゼロフィリングは補間を改善しますが、取得分解能は向上しません。面積は任意単位の信号×ppm 量であり、濃度ではありません。

材料系ワークフローの提案:検証、ルーティング、力計算、解析

実用的な評価の組み合わせ案は、Pymatgen → ASE ルーティング → 別の力計算プロバイダーワークフロー → Phonopy です。これはアーキテクチャ上の提案であり、テスト済みの統合ではありません。

まず Pymatgen の指示を使い、周期性、座標モード、占有率、警告、対称性への感度を調べます。変換前に表現の損失を特定し、往復変換後に科学的に重要な性質を比較します。

次に ASE のトップレベル Skill を使い、ワークフロー準備と計算器の設定を区別します。複合的なリクエストはまず ase/ase-workflows にルーティングし、ase/ase-calculators を依存関係とします。その出力は委任契約であり、エネルギーや力ではありません。GPAW と MACE はアダプターとして名前が挙げられていますが、提供されるルーターは詳細な動作を確立していません。実行要求は dpdisp-submit を通じて委任されます。

Phonopy では、セルのコンテキスト、スーパーセル、変位振幅、解析目的を指定します。力は別のプロバイダーが計算する必要があります。変位と力ファイルの対応を保持し、データが不完全または単位が不整合なら停止します。フォノン分散の経路、メッシュ、関連する長距離補正は明示的に決める必要があります。虚数モードについては、自動的に不安定と判断せず、収束性と設定の選択に照らして調査します。

熱力学と速度論は異なる問いに答える

Pymatgen のローカル凸包解析は、互換性のある計算エネルギーエントリーと、与えられた競合相を使用します。一方、pycalphad は熱力学 TDB を使って有限温度での平衡相分率と組成を計算します。Cantera ヘルパーは速度論的反応機構を使い、閉鎖系・断熱・均一な理想気体反応器を時間発展させます。これらは互いの代用にはなりません。

pycalphad には、独立な元素モル分率をちょうど N-1 個与え、従属元素には空孔以外の元素を指定します。選択相と除外相を記録し、モル分率、質量収支、サンプリング感度を確認します。同梱の Cu-Ni データベースは教育目的の仮想データであり、評価済み合金データベースではありません。平衡計算から析出速度や保持される微細構造は予測できません。

Cantera では定容か定圧かを確定し、反応機構の来歴を保持します。着火遅れは、均一な出力グリッド上で温度導関数が全体として最大になる時刻です。加熱が不十分な場合や、最大値が境界に現れる場合、遅延時間は null になります。比較前に、細分化と保存則のチェックを確認します。数値的な整合性は、反応機構や実験観測量の妥当性を証明しません。これらの出力は提案するプロセス研究の参考にはなりますが、どちらのヘルパーも汎用プロセス最適化ツールではありません。

反応 MD 解析と障害からの復旧

ReacNetGenerator の指示は、通常の軌跡解析、低レベルの制御、既存出力の確認を区別します。通常の LAMMPS dump ワークフローには rng-pipeline、より低レベルのオプションにはネイティブの reacnetgenerator、既存の化学種/反応ファイルの確認には rng-query を推奨しています。

ネットワークを解釈する前に、原子タイプのマッピング、スケール座標とデカルト座標の区別、周期セルの意味を確認します。別個の reacnet-md-tools ラッパーは、三斜晶セルを含む座標変換に対応します。マッピングが曖昧な場合は元素を推測せず、確認を求めます。HMM 処理を使ったかどうかを記録します。簡易な初回解析は科学的な妥当性確認ではありません。

ワークフロー全体で、入力が無効、実行依存関係が不足、科学的/数値的チェックに不合格、という3種の失敗を区別します。ログと元の成果物とともに、それぞれの状態を保持します。力データの欠落、解決していない着火遅延、不成立の平衡計算を、もっともらしく見える結果で置き換えてはいけません。

ライセンスの境界と読者向けチェックリスト

RDKit、Datamol、ASE では、個別ファイルとコレクションのライセンス表示に食い違いがあります。再利用または再配布の前に、対象となる成果物の適用範囲を確認してください。リポジトリが公開されているだけでは、ライセンスについて何も結論できません。ほかの Skill のライセンス表示も、力計算プロバイダーソフトウェア、速度論的反応機構、熱力学データベース、サービスデータを利用する権利を付与するものではありません。Materials Project は mp-api を通じてアクセスする外部データサービスであり、Pymatgen Skill が提供する API ではありません。

Skill を評価する前に:

  • 科学的な問いと必要な出力を特定する。
  • 指示、ヘルパー、ラッパー、エンジン、外部サービスを区別する。
  • ホストの権限と実行依存関係をそれぞれ独立に確認する。
  • 単位、規約、変換、ソース識別子を記録する。
  • 意図的に失敗する入力を含む、範囲を限定したケースから始める。
  • 数値チェックだけでなく科学的前提も精査する。
  • 設定、ハッシュ、バージョン、警告、未解決の判断を保持する。
  • ソフトウェアとデータのライセンス適用範囲を別々に確認する。

出典

以下の主要な指示ファイルが、ここで述べた役割と境界の根拠です。K-Dense の RDKit、Datamol、nmrglue、Pymatgen、Cantera、pycalphad。CCAS の ASE router、Phonopy、ReacNetGenerator。そして rdkit-agent Skill。適用範囲の確認には、コレクションの表示も比較してください:K-Dense ライセンスと CCAS ライセンス。