概要
Molfeat は、小分子を下流の機械学習ワークフロー向けの表現に変換するための共通インターフェースを提供します。単一の物性予測モデルを提供するのではなく、手設計の特徴量化器と事前学習済み分子埋め込みを1つのパッケージにまとめています。プロジェクトの README では、小分子に焦点を当てた 1.x の開発系列が説明されており、保守対象のグラフバックエンドとして PyTorch Geometric が挙げられています。また、CheMeleon や Mol-JEPA などとの統合も記載されています。
API の例では、Datamol の FreeSolv データセットから抽出した SMILES 文字列を使います。まず1つの分子に ECFP 計算器を適用し、次にその計算器を MoleculeTransformer でラップして、分子の集合を並列処理します。出力は、選択した特徴量化器に応じた分子特徴量または埋め込みです。Transformer の設定は YAML ファイルに保存し、そこから復元できます。ModelStore では、利用可能なモデルの一覧表示、名前による検索、モデルカードによる使用方法の確認ができます。
プラグインを使うと、独立して開発された特徴量化器でパッケージを拡張できます。オプションの依存関係により、Transformers の統合、Mordred 記述子、HDF5 および Parquet キャッシュ、S3 または Google Cloud のモデルストアなどの機能を利用できます。これらの依存関係がすべてコアインストールに含まれるわけではありません。README によると、必要な依存関係が不足している場合は、インストール方法の案内とともにエラーが表示されます。
ワークフローを選ぶ際は、対象範囲とライセンスに留意する必要があります。説明されている 1.x 系列では、タンパク質特徴量化器と、旧式の DGL、DGLLife、Graphormer アダプターが削除されています。リポジトリのコードライセンスは、ダウンロードした重みやカスタム Hub コードの利用条件を決定するものではありません。Mol-JEPA では、非商用ライセンスへの明示的な同意が必要です。出典の抜粋からは、下流予測の精度や比較実行時間の結果は確認できません。
主な機能
- 手設計の分子特徴量化器と事前学習済み埋め込みを、共通のパッケージインターフェースで組み合わせます。
- 単一分子の特徴量化には FPCalculator("ecfp")、分子集合の並列処理には MoleculeTransformer を提供します。
- MoleculeTransformer の設定を YAML 状態ファイルに保存し、復元できます。
- ModelStore を使ったモデルの一覧表示と検索に対応し、モデルカードによる使用方法の案内も利用できます。
- 独立して開発されたプラグインで特徴量化を拡張でき、オプションで HDF5 および Parquet のキャッシュをサポートします。
- 保守対象の CheMeleon および Mol-JEPA 統合を説明しており、モデルの遅延読み込みと外部チェックポイントのライセンス条件の明示に対応しています。
用途
- 評価案:固定したデータセットと評価手順を用いて、小分子の物性予測パイプラインへの入力として、ECFP 特徴量と事前学習済み埋め込みを比較します。
- 評価案:保存済みの transformer 設定とオプションのキャッシュが、データセット処理を繰り返す際の特徴量化の再現性に役立つかを評価します。
- 評価案:プラグインシステムを通じてカスタム分子特徴量化器を統合し、その出力がプロジェクトで想定する表現要件を満たすか確認します。
使い方
- 公式ドキュメントとリポジトリ READMEを読み、特徴量化器を選びます。説明されている 1.x 開発版の要件と、インストール予定のリリースの要件を区別してください。
- uv、pip、または conda-forge 向けの README のインストール手順に従います。選択した表現、キャッシュ形式、またはモデルストアに必要な、ドキュメントに記載されたオプション依存関係だけを選びます。
- README の API ツアーを出発点として、少数の SMILES 文字列を用意し、1つの分子に FPCalculator("ecfp") を適用してから、MoleculeTransformer で集合全体を処理します。
- 事前学習済み表現を使う場合は、ModelStore の一覧と選択したモデルカードの使用方法を確認します。成果物をダウンロードする前に、チェックポイントおよびカスタム Hub コードの条件を、リポジトリコードのライセンスとは別に確認してください。
- API ツアーの例に従って、transformer の設定を YAML に保存し、復元します。評価手順の案として、下流モデルに特徴量を組み込む前に、代表的な分子について出力次元、失敗する入力、再現性を確認します。