本文へスキップ

GuacaMol

BenevolentAI / BenevolentAI

GuacaMolは、分布学習と目標指向型評価、および標準化されたChEMBL由来データセットを備えた、de novo分子設計用のPythonベンチマークパッケージです。

掲載情報の更新 ·

概要

GuacaMolは分子を生成するモデルそのものではなく、分子生成モデルのベンチマークフレームワークを提供します。2種類の評価に対応しています。生成された分子が学習分布に類似しているかを評価する方法と、スコアリング目標に対する生成結果を評価する方法です。また、リポジトリから標準化されたChEMBL由来データセットにもリンクされており、評価ソフトウェアとベンチマークデータのソースの両方として利用できます。

分布学習ベンチマークでモデルを評価するには、DistributionMatchingGeneratorを実装し、そのインスタンスと学習セットのファイルの場所をassess_distribution_learningに渡します。目標指向型評価では、指定されたスコアリング関数に基づいて高スコアの分子を指定個数生成する役割を担うGoalDirectedGeneratorを実装し、assess_goal_directed_generationを呼び出します。これらのワークフローではベンチマーク評価が得られますが、出典の抜粋には結果ファイルの形式は記載されていません。別のベースラインリポジトリには、実装例とDocker環境の例があります。

データワークフローでは、公開済みのMD5ハッシュ値がある、あらかじめ構築された学習、検証、テスト、および統合データセットを利用できます。また、リポジトリにはChEMBLデータをダウンロードして準備する手順も含まれており、指定されたホールドアウトセットと非常によく似た分子を除外します。READMEでは、パッケージのバージョン差によって生成データセットが変わり、準備に失敗する可能性があると警告し、標準化データを再現するためのDockerベースの方法を説明しています。依存関係にはRDKitとFCDがあり、FCDはFréchet ChemNet Distanceの計算に使われます。提供されたドキュメントで確認できるのはベンチマークのワークフローであり、生成分子の前向きな検証や、特定モデルの性能を示す証拠ではありません。

主な機能

  • モデルアダプターと学習セットファイルを用い、`DistributionMatchingGenerator`と`assess_distribution_learning`を通じて分布学習評価を実施。
  • `GoalDirectedGenerator`と`assess_goal_directed_generation`を通じて目標指向型評価を実施し、与えられたスコアリング関数に対する分子生成に対応。
  • 公開済みのMD5チェックサムがある、あらかじめ構築されたChEMBL由来の学習、検証、テスト、および統合データセット。
  • 指定されたホールドアウトセットと非常によく似た分子を除外しながら、ChEMBLをダウンロードして処理するデータセット準備機能。
  • FCD依存関係を通じたFréchet ChemNet Distanceの計算。
  • ベンチマーク開発と標準化データセットの準備に使える、ベースラインモデルの実装とDocker環境へのリンク。

用途

  • 評価案:同じ標準化学習データセットを使い、分布学習ベンチマークで分子生成器を比較する。
  • 評価案:目標指向型のスコアリング目標のもとで、指定個数の分子を生成する能力を評価する。
  • 評価案:標準化されたChEMBL由来データセットを準備し、環境間でベンチマーク結果を比較する前に公開済みのハッシュ値を確認する。

使い方

  1. 公式READMEを読み、評価したい問いに応じて分布学習または目標指向型評価を選択します。ベンチマークの考え方とベースラインスコアの背景については、リンク先のベンチマーク論文を参照してください。
  2. READMEのインストール手順に従ってパッケージをインストールします。setup.pyと照らし合わせて依存関係を確認してください。依存関係の記載はREADMEと異なるため、両者が同一の環境を示すと想定しないでください。
  3. GuacaMolデータプロジェクトから該当するデータ分割を入手し、公開済みのMD5ハッシュ値を確認します。データを再生成する場合は、READMEの準備手順とDockerに関する案内に従ってください。
  4. モデル用にDistributionMatchingGeneratorまたはGoalDirectedGeneratorを実装します。ベースラインリポジトリは実装の参考として利用し、モデルの一部として扱わないでください。
  5. 対応する評価関数を呼び出します。分布学習の場合は、学習セットの場所を指定します。結果とともにデータセットの識別情報と環境を記録してください。READMEには、インストールを確認するためのユニットテストについても説明があります。

関連リソース

AIDDISON Explorer

プラットフォーム

AIDDISON Explorerは、目標プロファイル、設計上の制約、予測物性、合成可能性に基づいて分子候補を生成し、順位付けするホスト型創薬プラットフォームです。

分子生成 · 創薬

Chemistry42

プラットフォーム

Chemistry42 は、生成的設計、逆合成、ADMET と選択性の予測、物理ベースの優先順位付けを組み合わせた小分子創薬プラットフォームで、ヒット同定とリード最適化を支援します。

分子生成 · 創薬

3D分子を生成するE(3)等変拡散モデルの公式研究コード。QM9およびGEOM-Drugsの学習ワークフロー、サンプル分析、物性条件付き生成を含みます。

オープンソースPython

分子生成

FEgrow

オープンソース

FEgrowは、自由エネルギー計算の準備に向けたリガンド系列の対話的な構築を支援します。文書化されたアクティブ・ラーニングの例に加え、分子設計ワークフロー向けのDaskベースの高速化機能を備えています。

オープンソース

分子生成 · 創薬

GeoDiff

モデル

GeoDiff は分子コンフォメーション生成のための幾何拡散モデルであり、GEOM に基づく学習、チェックポイントからのサンプリング、コンフォメーションおよび物性の評価を行う公式コードを提供します。

オープンソースPython

分子生成 · 計算化学

GEOM

データセット

GEOM は、450,000 を超える分子について、エネルギーと統計重みの注釈付き分子配座を 3,700 万件提供します。データ形式には MessagePack と RDKit オブジェクトがあり、読み込みおよび解析のチュートリアルも用意されています。

Python

分子生成 · 計算化学

関連ガイド

ワークフロー

化学AIワークフローの再現性

科学的な問いをデータの出典と処理履歴、変換、モデル構成、出力、失敗に結び付ける簡潔な評価記録を作成し、化学AIの実践的な計画例を示します。