概要
Chemprop は、単一の事前学習済みモデルやホスト型予測サービスではなく、分子特性予測器を構築するためのフレームワークを提供します。公式ドキュメントでは、PyTorch ベースのメッセージパッシングニューラルネットワークが説明されており、学習、評価、予測を支援する CLI チュートリアルと Python モジュールが用意されています。ユーザーが独自の化学特性タスク向けにモデルを開発し、そのモデルを追加の入力に適用する研究ワークフローに適しています。
ドキュメントに記載されているデータワークフローには、データポイント、データセット、データローダー、分割、および分子と反応のグラフ特徴量化が含まれます。例では、分類、多成分回帰、反応回帰、マルチタスクモデルを扱っています。選択したワークフローに応じて、出力には特性予測、原子・結合の予測、または学習されたフィンガープリント表現が含まれます。また、モデルの保存と読み込み、アンサンブル、入力/出力のスケーリング、追加記述子、RayTune または Optuna を使ったハイパーパラメータ最適化もドキュメントに記載されています。正確な入力スキーマと出力形式は、該当するチュートリアルで確認してください。出典の抜粋には明記されていません。
その他のノートブックでは、不確実性定量化、アクティブラーニング、転移学習、ならびに Myerson 値、モンテカルロ木探索、Shapley 解析を用いた解釈を扱っています。これらはドキュメントに記載されたワークフローの選択肢であり、新しいデータセットでの精度を示すものではありません。バージョンの選択は重要です。README では、v2 で大幅な書き換えが行われ、デフォルトが変更され、v1 のサポートが終了したことが説明されています。また、エッジ更新の実装が引用された理論論文と異なる点も示されています。提供された情報からは、予測性能や特定の科学的エンドポイントへの適合性は確認できません。
主な機能
- メッセージパッシングニューラルネットワークモデル向けの Python モジュールチュートリアルに加え、CLI による学習・予測チュートリアルを提供。
- 分子および反応のグラフ特徴量化に対応し、分類、多成分回帰、反応回帰、マルチタスクの例を収録。
- 制約付き予測ノートブックを含む、原子・結合の特性予測。
- 学習されたフィンガープリントの抽出、モデルの保存と読み込み、アンサンブル、入力/出力のスケーリングのワークフローを提供。
- RayTune または Optuna を使ったハイパーパラメータ最適化のチュートリアルとノートブックを提供。
- 不確実性定量化、転移学習、Myerson 値、モンテカルロ木探索、Shapley 解析を用いた予測解釈のノートブック例を収録。
用途
- 評価案:分子特性データセットで分類または回帰モデルを学習し、ホールドアウト分割で予測を評価する。
- 評価案:対応する学習・予測ノートブックを使って、反応特性回帰または多成分回帰を検討する。
- 評価案:学習された分子フィンガープリントを抽出し、別個の下流解析における有用性を評価する。
- 評価案:関連する化学的エンドポイントについて、原子/結合の予測や解釈手法を調べ、分野固有の証拠に照らして有用性を確認する。
使い方
- Quickstart と Installation のページから始めてください。使用するリリースを選び、以前のセットアップ手順がそのまま適用されると仮定せず、当該リリースで文書化された環境要件を確認してください。
- datapoints tutorial と data splitting tutorial を確認してください。入力とターゲットを選択したタスクに合わせ、別個の評価用分割を計画してください。
- CLI training tutorial に従うか、適切な notebook example を選択してください。ワークフローを拡大する前に、小規模な評価実行から始めてください。
- 学習済みモデルを再利用して予測を確認するには、saving and loading models と prediction tutorial を参照してください。
- 必要に応じて、hyperparameter optimization または uncertainty quantification を検討してください。設定の選択を記録し、タスクへの影響を評価してください。これらは推奨される確認事項であり、報告済みのベンチマーク結果ではありません。