まず参照問題を定義する

原子間ポテンシャルの評価は、リポジトリの順位付けではなく、科学的な仕様の策定から始める必要があります。このコレクションでは、計算化学と材料探索を目的とする4つの候補プロジェクトを取り上げます。それぞれのワークフロー、チェックポイント、シミュレーションインターフェースを互換なものとして扱ってはなりません。

元素、該当する場合は電荷とスピン、分子または周期構造、幾何構造の範囲、想定用途を網羅する1ページの仕様書を作成します。単一点予測、構造最適化、分子動力学を区別してください。それぞれに独自の受け入れ基準が必要です。

エネルギー単位、座標単位、力の規約、境界条件、エネルギー補正など、参照計算の手順を記録します。必要な出力が全エネルギー、相対エネルギー、力、応力、その他の物性のどれかを決めます。この適用範囲をすべての比較に添付し、ある領域の結果を別の領域の根拠として提示しないようにします。

4つのプロジェクトを個別に調べる

以下の機能は、プロジェクト資料に記載されたものです。ChemAI Atlasによるテスト結果ではありません。

  • MACE は、高次の等変原子間ポテンシャル、学習およびXYZベースの評価ワークフロー、学習済みモデルの推論、ファインチューニングを提供します。ASEの例では、計算器の使用方法が示されています。資料では、材料向けのMACE-MPと有機化学向けのMACE-OFFモデルが区別されているため、モデル系列の選択も評価の一部となります。
  • NequIP は、E(3)等変原子間ポテンシャルのフレームワークです。ドキュメントでは、基盤ポテンシャル、コンパイル、ファインチューニング、ASEおよびLAMMPSインターフェースが説明されています。Allegroは別個の拡張パッケージであり、コアフレームワークの別名ではありません。正確なデータスキーマと予測インターフェースについては、該当するガイドで確認する必要があります。
  • SchNetPack は、SchNetとPaiNNの表現を用いた原子ネットワークの構築と学習をサポートします。例では、量子化学的な物性や、力および応力の微分を伴うエネルギー面が扱われています。また、分子動力学コンポーネントとLAMMPSインターフェースについても説明されています。このツールボックスを単一の学習済みポテンシャルと見なすのではなく、モデル構成を選択してください。
  • TorchANI は、任意でC++およびCUDA拡張を使いながら、PyTorchでANI形式のポテンシャルを開発、学習、使用することをサポートします。READMEでは、機械学習およびML/MMシミュレーション全体に対応する別個のTorchANI-Amberインターフェースが案内されています。出典の抜粋からは、個々のモデルの適用範囲、入力スキーマ、出力構造は確認できません。

各候補について、具体的なモデルが対象の化学系に対応しているのか、それともプロジェクトがモデルを学習するための基盤を提供しているだけなのかを確認してください。

比較ワークシートを作成する

リポジトリごとではなく、選定したリリースとモデル資産ごとに1行を作成します。以下の項目を使い、根拠が不足している箇所を明示します。

項目 記録内容
識別情報 リリースまたはコミット、モデル識別子、資産の出所
化学的適用範囲 元素、系、電荷/スピン条件、文書に記載された除外事項
参照データ 学習データの出典、理論レベル、エネルギー規約
入力 幾何構造スキーマ、ラベル、単位、セル、前処理
出力 物性名、形状、単位、微分の規約
学習 分割ファイル、シード、損失、設定、参照エネルギーの扱い
配備 計算器またはシミュレーションインターフェース、コンパイル、依存関係
根拠の状態 資料に記載、評価で確認予定、ローカルで検証済み、または不明

該当する確認をチームが実際に実施し、記録するまでは「ローカルで検証済み」としてはなりません。記録されていない条件は、想定上の既定値とせず、不明のままにしてください。

判断のための問いを使って候補を絞り込みます。必要なラベルは利用可能か。一致する学習済み資産が文書に記載されているか。選択したインターフェースから目的の出力を取得できるか。モデルの適応によって比較の範囲や予算が変わるか。

スコアリング前に入出力をそろえる

以下は提案する評価手順であり、プロジェクト間の統合をテストしたものではありません。

  1. 安定した構造識別子を付けた小規模な参照セットを固定し、元の計算記録を保存します。
  2. 各プロジェクトに必要な入力を個別に準備します。変換後に、元素の符号化、原子順序、座標、セル情報、物性ラベルを確認します。
  3. 出力を共通の比較表に対応付けて記録します。構造識別子、予測エネルギーと参照エネルギー、原子インデックスに対応した力の成分を含めます。応力は必要であり、選択した構成でサポートされる場合に限り含めます。
  4. 誤差を計算する前に、単位、力の符号、エネルギーオフセット、全量と原子当たりのどちらで報告されているかを確認します。
  5. 変換の失敗、未対応の入力、有限でない予測値は別の失敗ログに記録し、分母から黙って除外しないでください。

MACEのドキュメントでは、XYZファイルと保存済みモデルから評価し、出力XYZファイルを生成する方法が説明されています。これは、他のプロジェクトにも同一のファイル仕様があることを示すものではありません。同様に、シミュレーションインターフェースが文書化されていても、インストール済み環境との互換性が証明されるわけではありません。

計画例:中性分子の配座

**仮定上の例:**炭素、水素、窒素、酸素を含む中性分子について、配座間の相対エネルギーと力を求めたいチームを想定します。これは計画上のシナリオであり、性能結果ではありません。

チームはまず単一の参照電子状態計算手順を定め、ラベル付き構造の一覧を作成します。ランダムなフレーム割り当てだけに頼るのではなく、配座ファミリーを学習、検証、テストセットに分けることもできます。別途ラベル付けしたチャレンジセットには、想定する適用範囲外の、より歪んだ幾何構造を含めることができます。

MACEについては、有機モデル資産または学習ワークフローを調査し、参照化学系を確認します。NequIPについては、文書に記載された学習済み資産が仕様に適合するか、あるいは学習が必要かを確認します。SchNetPackについては、表現方式とエネルギー/力の出力構成を選択します。TorchANIについては、まず選定したモデルの元素と分子領域をドキュメントで確認します。

想定する成果物は、適用範囲のワークシート、整合させた予測表、失敗報告です。資産のエネルギー基準がチームの参照手法と異なる場合、その違いを解消するか、別個の問いとして評価してください。生の絶対エネルギー差だけから劣っていると結論づけてはなりません。

再現性、資産、制約を確認する

将来的な結果とともに、ソフトウェアのバージョン、設定ファイル、データセット分割、前処理の選択、チェックポイント識別子を保存します。コード、学習済み重み、学習データは、それぞれ出所と適用される利用許諾を確認してください。リポジトリのメタデータだけで資産の利用可否を判断してはなりません。

移行やプラットフォームの制約も重要です。MACEは、書き換えに際してコードとチェックポイントの移行に注意が必要であると説明しています。一方、NequIPとTorchANIは、既存ユーザーに関わる互換性の変更について説明しています。参照資料では、TorchANIはAMD GPUおよびApple MPSのサポートが未テストであると明記しています。これらは資料に記載された条件として記録し、このコレクションによる互換性の結論とはしないでください。

またMACEは、生のMACE-MP DFTエネルギーを、互換性補正が適用されたMaterials Projectのエネルギーと直接比較できないと注意しています。さらに一般に、インストールの成功、リポジトリの人気、アーキテクチャの共通性は、科学的な転移可能性を示すものではありません。平均誤差に加えて、構造ごとの失敗や、分布外挙動を個別に調べた結果も示す必要があります。

簡易評価チェックリスト

  • 化学系、目的の出力、受け入れ基準を定義する。
  • 特定可能なリリースとモデル資産を選ぶ。
  • 適用範囲やインターフェースに関する根拠が不足している箇所は不明と記す。
  • 参照計算、データ分割、変換記録を固定する。
  • スコアリング前に単位と規約を確認する。
  • 失敗、出所、再現性に関する詳細を保存する。

このコレクションは編集レビュー待ちです。性能ランキング、一人称による科学的テスト、テスト済みの統合に関する主張は含みません。