概要
GEOM は、物性予測および分子生成の研究を目的とした分子配座データセットです。プロジェクトの README では、450,000 を超える分子を網羅する 3,700 万件の配座と、エネルギーおよび統計重みの注釈が記載されています。このリポジトリにはデータへのアクセスと解析のための Jupyter チュートリアルがあり、単体の予測モデルは含まれていません。配座ベースのモデルの学習については、別の Neural Force Field リポジトリが案内されています。
データはリンク先のデータアーカイブから配布されています。4 つの MessagePack アーカイブには、薬物様分子と QM9 分子の未加工および特徴量化表現が含まれており、複数のプログラミング言語から読み込めます。Python ワークフロー向けには、rdkit_folder.tar.gz に座標と結合情報を含む RDKit mol オブジェクトが用意されています。文書化されたワークフローでは、ダウンロードしたアーカイブから分子レコードを読み込み、可視化、派生記述子の計算、または PDB 形式へのエクスポートを行います。分子ごとの軽量な JSON サマリーを使えば、個々の RDKit pickle ファイルを読み込む前にレコードを選択できるため、すべての配座を先に読み込む必要はありません。
README では、16,000 を超える MoleculeNet 化学種の追加についても説明しています。これには CREST アンサンブルが含まれ、BACE サブセットには Hessian データと高精度 DFT 結果も含まれます。専用チュートリアルでは、これらのレコードの読み込み方法と、異なる理論レベルで得られたアンサンブルの比較方法を説明しています。重要な配布上の制約として、Python 専用データに新しい分子が追加されても、MessagePack ファイルは更新されません。そのため、ユーザーは必要な網羅範囲を考慮して表現形式を選び、チェックサムの検証についてはアーカイブの README を確認してください。文書に記載された依存環境は情報源で報告されたセットアップであり、他の環境との互換性を示すものではありません。
主な機能
- 450,000 を超える分子にわたる 3,700 万件の分子配座に、エネルギーと統計重みの注釈を付与。
- 言語に依存しない 4 つの MessagePack アーカイブ:`drugs_crude.msgpack.tar.gz`、`drugs_featurized.msgpack.tar.gz`、`qm9_crude.msgpack.tar.gz`、`qm9_featurized.msgpack.tar.gz`。
- 配座座標と分子の結合情報を含む Python 専用の RDKit `mol` レコード。可視化、記述子の生成、PDB 形式へのエクスポートのチュートリアルも用意されています。
- 個々の配座レコードを読み込む前に分子を選択できる、軽量な `rdkit_folder/{drugs,qm9}_summary.json` ファイル。
- CREST アンサンブルを含む MoleculeNet の追加データ。BACE サブセットには Hessian データと高精度 DFT 結果も含まれます。
- MoleculeNet レコードの読み込みや、異なる理論レベルで得られたアンサンブルの比較に関するチュートリアル。
用途
- 評価案:注釈付き配座アンサンブルを、分子生成または配座ベースの物性予測の学習データや評価データとして使用します。別途リンクされた Neural Force Field の学習ワークフローも参照してください。
- 解析案:サマリー JSON ファイルで特定の物性に基づく分子サブセットを選び、その後、データセット全体を先に読み込まずに配座を可視化したり、RDKit 記述子を導出したりします。
- 評価案:アンサンブル比較チュートリアルを使って、利用可能な MoleculeNet アンサンブルを理論レベル間で比較します。該当する場合は、文書に記載された BACE 固有の結果も含めます。
使い方
- リポジトリの READMEを読み、データセットの表現形式と文書化された依存環境を確認します。複数言語からアクセスする場合は MessagePack、Python ワークフローでは RDKit レコードを選択してください。
- データアーカイブにアクセスして必要なファイルを選び、チェックサムの検証についてはアーカイブの README を参照します。分子の網羅範囲を評価する際は、記載されている MessagePack ファイルの更新停止を考慮してください。
- 展開と読み込みには MessagePack 読み込みチュートリアルを、Python 専用レコードには RDKit チュートリアルを利用してください。
- 対象を絞った解析では、個々の RDKit pickle ファイルを読み込む前にサマリー JSON ファイルを確認します。RDKit チュートリアルを使って配座を調べ、記述子を生成し、または PDB ファイルをエクスポートしてください。
- 追加された化学種については、MoleculeNet チュートリアルとアンサンブル比較チュートリアルを参照してください。データを使用する際は、GEOM 論文を引用してください。