本文へスキップ

ANI-1

ANI-1 は、計算された非平衡分子配座を提供し、有機分子の座標とエネルギーを含む HDF5 ファイルにアクセスするための Python リーダーを備えています。

掲載情報の更新 ·

概要

ANI-1 は分子参照データセットであり、レコードへのアクセスに使うスクリプトを含むサポートリポジトリが付属しています。README は、このデータセットを説明する論文を引用しており、そこでは有機分子の計算済み非平衡配座 2,000 万件が記載されています。また、初期の ANI-1 ニューラルネットワークポテンシャルに関する論文も引用されています。この項目で扱うのはデータセットとその抽出ユーティリティであり、実行可能なポテンシャルやモデル学習フレームワークではありません。

ダウンロード可能なアーカイブは Figshare 経由でリンクされており、展開すると ANI-1_release ディレクトリが作成されます。データは ani_gdb_s0x.h5 という名前の 8 個の HDF5 ファイルに分けて格納されています。x は 1 から 8 までの値を取り、各ファイルに含まれる分子の重原子数(C、N、O)を示します。文書に記載されている量には、単位をオングストロームとする分子座標と、単位を Hartree とするエネルギーが含まれます。README には H、C、N、O の自己相互作用原子エネルギー値も記載されています。

アクセス手順では Python、NumPy、h5py を使用します。提供されている pyanitools.py にはデータセットの読み込みと解析を行う anidataloader クラスが含まれ、example_data_sampler.py はそのローダーを使ったサンプリング方法を示しています。アーカイブには、著者の独自形式でのデータ読み込みと保存を支援すると説明されているクラスも含まれています。これらのユーティリティは、後続の分子モデリングワークフロー向けに参照データを抽出するための出発点となります。

README では Python 3.5 以降が指定され、明記されているリーダーのテスト範囲はそのバージョン範囲に限られています。特定の現行環境との互換性が確認されているわけではありません。出典の抜粋には、完全なレコードスキーマ、学習手順、予測性能評価についての記載はありません。リポジトリの MIT ライセンスはソフトウェアを対象としていますが、これらの抜粋からはデータセットの再利用条件は確認できません。

主な機能

  • 8 個の HDF5 データファイルで、C、N、O 原子を 1 個から 8 個含む分子を重原子数ごとに整理しています。
  • `pyanitools.py` の `anidataloader` クラスは ANI-1 データを読み込み、解析します。
  • `example_data_sampler.py` は、付属のローダーを使ってレコードをサンプリングする方法を示しています。
  • アーカイブには、著者の独自形式でデータを読み込み、保存するための Python クラスが含まれています。
  • README には、座標の単位がオングストローム、エネルギーの単位が Hartree と記載され、H、C、N、O の自己相互作用原子エネルギー値も示されています。

用途

  • 評価案:座標とエネルギーのサンプルを抽出し、分子エネルギー予測ワークフローの参照データとして ANI-1 を利用できるか評価します。
  • 評価案:学習用と検証用の分割を設計する際、重原子数ごとにグループ化されたデータサブセットを比較します。
  • 評価案:サンプリングした非平衡配座が、分子の幾何構造とエネルギーの関係を調べる研究に適しているか確認します。

使い方

  1. サポート README を読み、アーカイブの構成、依存関係、単位を確認します。科学的背景については、引用されているデータセット論文を参照し、ANI-1 を使用する際には指定された 2 件の引用を両方とも記載してください。
  2. リンク先の Figshare collection からデータセットアーカイブを取得します。README に記載された Unix ベースのアーカイブ手順で展開し、生成された ANI-1_release ディレクトリを探します。
  3. Python、NumPy、h5py を含む環境を用意します。README では Python 3.5 以降が指定されていますが、その記述を現行環境との互換性検証とみなさず、使用する環境に適しているか確認してください。
  4. 文書に記載された設定手順に従い、ANI-1_release/readers/lib/ を PYTHONPATH に追加します。文書で説明されているアクセス確認として example_data_sampler.py を実行する前に、pyanitools.py とサンプルリーダーを調べてください。
  5. 重原子数に応じて該当する ani_gdb_s0x.h5 ファイルを選びます。後続の解析の前に、サンプリングしたレコードを検証し、記載された単位を維持するとともに、データセットの再利用条件をリポジトリのソフトウェアライセンスとは別に確認してください。

関連リソース

DeePKS

モデル

DeePKS-kit は、量子化学のエネルギー汎関数の学習、post-HF モデルのテスト、および DeePHF と DeePKS のスキームによる自己無撞着計算を行うための Python ツールキットです。

オープンソースPython

量子化学

DeePTB

モデル

DeePTB は、深層学習による電子構造モデル向けの Python パッケージです。環境依存のタイトバインディングモデルと、等変なハミルトニアン、密度行列、重なり行列の表現を組み合わせています。

オープンソースPython

量子化学 · 材料探索

DimeNet

モデル

DimeNetは、分子グラフ上の方向性メッセージパッシングに用いるDimeNetおよびDimeNet++の参照実装を提供し、学習ノートブック、テストセット予測ワークフロー、事前学習済みモデルを含みます。

Python

分子特性予測 · 量子化学

PhysNet

モデル

PhysNetは、分子のエネルギー、力、双極子モーメント、部分電荷を予測するニューラルネットワークのTensorFlow実装です。設定可能なトレーニングワークフローとサンプルデータセットを備えています。

オープンソースPython

分子特性予測 · 量子化学

QCArchiveは、データベースを基盤とするサーバー、Pythonクライアント、および同一リポジトリで保守される計算ワーカーを通じて、量子化学計算の実行、保存、共有を支援します。

オープンソースPython

量子化学 · 科学データ

QML

オープンソース

QML は、Fortran による表現、カーネル、ソルバーモジュールを備えた、アーカイブ済みの量子機械学習向け Python ツールキットです。以降の開発は qmllib に移行しています。

オープンソースPython

分子特性予測 · 量子化学