科学的な問いを明確にする
再現可能な化学AIワークフローには、保存されたモデルとスコアだけでは不十分です。何を評価したのか、手順をどのように再構築するのか、結果が意図した判断を裏付けるかを他の研究者が判断できるだけの背景情報が必要です。
まず、評価の概要を簡潔にまとめます。対象とする物性または生成目標、関連する実験条件、想定される用途、有用な回答の基準を記します。実測エンドポイントの予測と計算スコア関数の最適化を区別してください。どちらも、それだけで実験上の有用性が確立するわけではありません。
考えてみましょう。この評価はどの判断に役立つのでしょうか。判断時にどの入力を利用できますか。どのような誤りがあれば出力は不適切になりますか。モデルを選択したり結果を調べたりする前に、これらの点を定めてください。
評価上の役割に応じてリソースを選ぶ
リンク先のリソースの参照情報が説明するのは、それぞれ異なる役割であり、すでに検証済みの統合ワークフローではありません。
- RDKit は分子操作、記述子、フィンガープリントを提供します。想定する前処理段階や特徴生成段階を支援できます。実際に選んだ操作を記録してください。
- Chemprop は、メッセージパッシングニューラルネットワークを用いた学習、評価、予測について、分子および反応のワークフローを含めて説明しています。すべてのタスクで同じ入力形式が使えると仮定せず、該当するチュートリアルを選んでください。
- GuacaMol は、分布学習と目標指向の分子生成ベンチマーク、および標準化された ChEMBL 由来データセットを提供します。これは評価フレームワークであり、生成器そのものではありません。
- MOSES は、分子生成の参照データ、ベースライン、妥当性、新規性、多様性などの集合レベルの指標をまとめています。
- Matbench は、厳選された13の材料科学予測タスクを提供します。評価を計画する前に各タスクの定義を確認する必要があります。
問いに合ったタスクとデータを備えるリソースを選んでください。この一覧は、パッケージ間の互換性や、手元のデータでの性能を示すものではありません。
環境と構成を固定する
実行前にランマニフェストを作成します。コードのリビジョン、依存関係のバージョン、モデル構成、チェックポイント識別子、乱数シード、必要に応じてハードウェアを記録してください。記憶に頼ったデフォルト設定に依存せず、構成ファイルを結果とともに保存します。
バージョンの選択は、特に Chemprop で重要です。用意された参照情報では、大幅な v2 の書き直し、デフォルト設定の変更、v1 サポートの終了が説明されています。実際に使用したバージョンを記録し、異なるリリースのワークフローを相互に置き換えられると仮定しないでください。
環境の再構築と数値的な再現性は区別してください。依存関係を保存すれば実行の再現に役立つ場合がありますが、出力が同一になるとは限りません。適切な場合は反復実行を計画し、根拠なく決定性を主張するのではなく、観察されたばらつきを記録してください。
入力と変換を保持する
許可される範囲で変更不可のソースデータコピーを保持し、派生データは別の場所に保存します。データセットの出所、安定した識別子、チェックサム、目的変数の定義、単位、測定条件を記録してください。派生した各レコードをソースに結び付ける変換ログを残します。
各前処理について、その目的と影響を記録します。対象には分子の正規化、重複の処理、ラベル欠損による除外、特徴生成、単位変換が含まれます。こうした変更に用いたコードと構成を保存してください。レコードを除外した場合、許可される範囲で識別子と除外理由を保持します。
入出力の契約を明示します。想定される物性予測ワークフローでは、識別子と実測値を含む分子レコードを受け取り、それらの識別子にひも付いた予測を出力することが考えられます。具体的なパッケージのスキーマは、該当するドキュメントで確認する必要があります。MOSES について、リンク先の参照情報では、生成された SMILES が指標の入力であり、metrics.csv がベースラインワークフローの出力であると明記されています。
結果を選ぶ前に評価を設計する
分割の割り当てを保存し、それが想定する導入環境を代表する理由を説明してください。関連構造、反復測定、前処理上の判断によって、学習データと評価データの間でデータリークが生じる可能性がないか確認します。データから学習する変換も含め、モデル選択と最終評価を分離してください。
候補を比較する前に、ベースラインと指標を選びます。指標の定義、集約ルール、除外項目、各比較の妥当性を裏付ける根拠を記録してください。最良スコアだけでなく、予測、誤差、失敗した実行、ベースラインの結果も保持します。
生成タスクでは、要求したサンプル数と返されたサンプル数、スコアリング目標、無効な出力、反復実行の手順を記録します。MOSES は少なくとも30,000個の生成分子と、指標の分散を推定するための反復実験を推奨しています。GuacaMol は分布学習と目標指向の評価に異なるインターフェースを提供します。どの評価を使用したか記録してください。これらのスコアを、生成分子の前向き検証と解釈しないでください。
計画例:仮想的な物性研究
あるチームが、実測エンドポイントを対象に、分子物性予測器と記述子ベースのベースラインを比較したいとします。これは仮想的な計画であり、完了した実験や検証済みの統合ではありません。
- 判断を定める。 予測器を、後続の測定対象とする化合物の優先順位付けに使うのかを明確にします。学習前に、エンドポイント、単位、条件、許容誤差の基準を記録してください。
- 入力を固定する。 レコード識別子、分子表現、ラベルを含むソーステーブルを保持します。合意された正規化と除外を適用した後、記録された派生テーブルを作成します。
- 評価を準備する。 データ分割の所属と、想定用途を反映した理由を保存します。最終評価データは候補の選択から分離してください。
- 候補ワークフローを定める。 ベースラインには RDKit 記述子を、比較対象には Chemprop モデルを提案します。統合を試みる前に、選択したインターフェースとデータ処理を確認してください。
- 出力を保持する。 計画した各実行について、識別子にひも付いた予測、構成、チェックポイント参照、ベースライン出力、指標、失敗ログを保存します。
- 判断を下す。 あらかじめ定めた基準に照らして結果を比較し、重要な誤りの事例を調べます。条件の欠落やデータのカバレッジ不足により意味のある結論が得られない場合は、最高スコアを強調するのではなく、その制約を記録してください。
最終的な記録では、比較を再実行する方法と、それが科学的な問いに答えている、あるいは答えられていない理由の両方を説明する必要があります。
根拠を添え、限界を明記する
ソースに記載された機能、ローカルで観察された結果、提案する評価手順を区別してください。根拠となる主張とドキュメントへのリンクを対応付けてください。ソースの確認を行った場合は、実験日とは分けて確認日を記録します。リンクがあるだけでは、レビューを完了した証拠になりません。
ベンチマークには適用範囲の限界があります。MOSES は選別された化学物質の参照コレクションを使用するため、その比較は制約のない化学空間を表すものではありません。出典の抜粋には、Matbench のタスク入力、指標、分割の詳細は記載されていません。実行を設計する前に、そのドキュメントを確認してください。再現可能な計算結果であっても、領域知識に基づく解釈が必要であり、生物活性や合成可能性を確立するものではありません。
記録を維持する:実行可能なチェックリスト
担当者を割り当て、新しいデータ、依存関係の変更、モデルの改訂、前処理の変更など、再評価を開始する条件を定めます。成果物の保存場所とアクセス要件を含む復旧手順を保持してください。
評価を終える前に、次を確認します。
- 科学的な問いと判断基準が明確である。
- 入力、変換、データ分割の割り当てを追跡できる。
- 環境、構成、チェックポイントが記録されている。
- 出力、除外、失敗、ベースラインが保持されている。
- ソースの記述と実験で得た結果が区別されている。
- 限界、担当者、再評価の条件が記録されている。
リソースの検索と科学タスクも参照し、関連する記録やソースへのリンクを特定してください。このガイドは、科学的性能や互換性を認証するものではありません。