本文へスキップ

GEOM

GEOM は、450,000 を超える分子について、エネルギーと統計重みの注釈付き分子配座を 3,700 万件提供します。データ形式には MessagePack と RDKit オブジェクトがあり、読み込みおよび解析のチュートリアルも用意されています。

掲載情報の更新 ·

概要

GEOM は、物性予測および分子生成の研究を目的とした分子配座データセットです。プロジェクトの README では、450,000 を超える分子を網羅する 3,700 万件の配座と、エネルギーおよび統計重みの注釈が記載されています。このリポジトリにはデータへのアクセスと解析のための Jupyter チュートリアルがあり、単体の予測モデルは含まれていません。配座ベースのモデルの学習については、別の Neural Force Field リポジトリが案内されています。

データはリンク先のデータアーカイブから配布されています。4 つの MessagePack アーカイブには、薬物様分子と QM9 分子の未加工および特徴量化表現が含まれており、複数のプログラミング言語から読み込めます。Python ワークフロー向けには、rdkit_folder.tar.gz に座標と結合情報を含む RDKit mol オブジェクトが用意されています。文書化されたワークフローでは、ダウンロードしたアーカイブから分子レコードを読み込み、可視化、派生記述子の計算、または PDB 形式へのエクスポートを行います。分子ごとの軽量な JSON サマリーを使えば、個々の RDKit pickle ファイルを読み込む前にレコードを選択できるため、すべての配座を先に読み込む必要はありません。

README では、16,000 を超える MoleculeNet 化学種の追加についても説明しています。これには CREST アンサンブルが含まれ、BACE サブセットには Hessian データと高精度 DFT 結果も含まれます。専用チュートリアルでは、これらのレコードの読み込み方法と、異なる理論レベルで得られたアンサンブルの比較方法を説明しています。重要な配布上の制約として、Python 専用データに新しい分子が追加されても、MessagePack ファイルは更新されません。そのため、ユーザーは必要な網羅範囲を考慮して表現形式を選び、チェックサムの検証についてはアーカイブの README を確認してください。文書に記載された依存環境は情報源で報告されたセットアップであり、他の環境との互換性を示すものではありません。

主な機能

  • 450,000 を超える分子にわたる 3,700 万件の分子配座に、エネルギーと統計重みの注釈を付与。
  • 言語に依存しない 4 つの MessagePack アーカイブ:`drugs_crude.msgpack.tar.gz`、`drugs_featurized.msgpack.tar.gz`、`qm9_crude.msgpack.tar.gz`、`qm9_featurized.msgpack.tar.gz`。
  • 配座座標と分子の結合情報を含む Python 専用の RDKit `mol` レコード。可視化、記述子の生成、PDB 形式へのエクスポートのチュートリアルも用意されています。
  • 個々の配座レコードを読み込む前に分子を選択できる、軽量な `rdkit_folder/{drugs,qm9}_summary.json` ファイル。
  • CREST アンサンブルを含む MoleculeNet の追加データ。BACE サブセットには Hessian データと高精度 DFT 結果も含まれます。
  • MoleculeNet レコードの読み込みや、異なる理論レベルで得られたアンサンブルの比較に関するチュートリアル。

用途

  • 評価案:注釈付き配座アンサンブルを、分子生成または配座ベースの物性予測の学習データや評価データとして使用します。別途リンクされた Neural Force Field の学習ワークフローも参照してください。
  • 解析案:サマリー JSON ファイルで特定の物性に基づく分子サブセットを選び、その後、データセット全体を先に読み込まずに配座を可視化したり、RDKit 記述子を導出したりします。
  • 評価案:アンサンブル比較チュートリアルを使って、利用可能な MoleculeNet アンサンブルを理論レベル間で比較します。該当する場合は、文書に記載された BACE 固有の結果も含めます。

使い方

  1. リポジトリの READMEを読み、データセットの表現形式と文書化された依存環境を確認します。複数言語からアクセスする場合は MessagePack、Python ワークフローでは RDKit レコードを選択してください。
  2. データアーカイブにアクセスして必要なファイルを選び、チェックサムの検証についてはアーカイブの README を参照します。分子の網羅範囲を評価する際は、記載されている MessagePack ファイルの更新停止を考慮してください。
  3. 展開と読み込みには MessagePack 読み込みチュートリアルを、Python 専用レコードには RDKit チュートリアルを利用してください。
  4. 対象を絞った解析では、個々の RDKit pickle ファイルを読み込む前にサマリー JSON ファイルを確認します。RDKit チュートリアルを使って配座を調べ、記述子を生成し、または PDB ファイルをエクスポートしてください。
  5. 追加された化学種については、MoleculeNet チュートリアルとアンサンブル比較チュートリアルを参照してください。データを使用する際は、GEOM 論文を引用してください。

関連リソース

GeoDiff

モデル

GeoDiff は分子コンフォメーション生成のための幾何拡散モデルであり、GEOM に基づく学習、チェックポイントからのサンプリング、コンフォメーションおよび物性の評価を行う公式コードを提供します。

オープンソースPython

分子生成 · 計算化学

MolSimplify

オープンソース

molSimplifyは、計算スクリーニング向けの無機配位錯体および分子間錯体を生成します。また、八面体遷移金属錯体の一部の特性を予測するニューラルネットワークを同梱しています。

オープンソースPython

分子生成 · 計算化学

AIDDISON Explorer

プラットフォーム

AIDDISON Explorerは、目標プロファイル、設計上の制約、予測物性、合成可能性に基づいて分子候補を生成し、順位付けするホスト型創薬プラットフォームです。

分子生成 · 創薬

Allegro

モデル

Allegro は NequIP の拡張として E(3) 等変原子間ポテンシャルを実装し、文書化された GPU 高速化オプションと、LAMMPS シミュレーション用の独立したプラグインを提供します。

オープンソースPython

計算化学 · 材料探索

ASE

オープンソース

ASE は原子シミュレーション向け Python ライブラリで、共通の計算器インターフェースを通じて従来の計算コードと外部の機械学習ポテンシャルを接続します。

オープンソースPython

計算化学

computational-chemistry-agent-skills コレクションに含まれる ASE ルーティング Skill。ワークフローの準備と計算器の設定を分け、実行は別の担当先に委任します。

計算化学 · 材料探索

関連ガイド

データセット

化学AIデータセットの出典とライセンス

データを統合したりモデル評価を設計したりする前に、化学データセットの出所、利用条件、識別子、変換過程を追跡できる監査可能な記録を作成します。