本文へスキップ

DiffDock

Gabriele Corso, Hannes Stärk, Bowen Jing, Regina Barzilay and Tommi Jaakkola; code maintenance led by Jacob Silterra since 2024

DiffDockは拡散ベースのモデルを用いてタンパク質–低分子の結合ポーズを予測します。単一複合体およびバッチ推論、配列ベースのタンパク質入力、ポーズの信頼度スコアに対応しています。

掲載情報の更新 ·

概要

DiffDockは、低分子がタンパク質に結合した状態の三次元構造を予測する研究用実装です。分子ドッキングワークフローにおけるポーズ生成段階に対応しており、結合親和性を直接推定するものではありません。プロジェクトのREADMEによると、このリポジトリではデフォルトでDiffDock-Lが実行されます。オリジナルのDiffDockモデルを利用したい場合は、リポジトリの履歴を確認するよう案内されています。

入力には、.pdb形式のタンパク質構造と、SMILES文字列またはRDKitで読み取り可能な.sdfや.mol2などのファイルで表したリガンドを組み合わせられます。また、タンパク質配列を入力すると、ワークフロー内でESMFoldを用いて折りたたみます。個々の複合体は直接指定でき、複数のタンパク質–リガンドペアを記述したCSVを使ってバッチ推論を行うこともできます。出力には予測された結合構造と信頼度スコアが含まれます。リポジトリには単一複合体用のローカルGUIも記載されており、ホスト型のHugging Face Spacesインターフェースへのリンクもあります。

信頼度スコアは予測ポーズに対するモデルの確信度を表し、結合親和性を示すものではありません。またREADMEでは、異なる複合体間やタンパク質構造間で単純に比較しないよう注意を促しています。スコアの解釈に関する説明は、学習時の設定に似た入力、すなわち薬物様リガンドと、結合状態に近い構造をとる中型のタンパク質を想定しています。このモデルは低分子のタンパク質へのドッキングを目的としており、より大型の生体分子間の相互作用を対象としていません。下流で親和性を推定する場合、予測構造を緩和してから、別のスコアリング法または自由エネルギー法を適用することを著者は推奨しています。提供された.pdb構造を用いるローカル推論はCPU実行にも対応していますが、READMEではGPUの使用を推奨しています。

主な機能

  • タンパク質–低分子複合体構造を予測し、ポーズの信頼度スコアを出力します。現在のリポジトリではデフォルトでDiffDock-Lが使われます。
  • タンパク質の`.pdb`ファイル、またはESMFoldで折りたたむタンパク質配列を受け付けます。
  • リガンドのSMILES文字列、および`.sdf`や`.mol2`を含むRDKitで読み取り可能な分子ファイルを受け付けます。
  • 単一複合体の推論と、タンパク質およびリガンドの入力を含むCSVレコードからのバッチ推論に対応しています。
  • ローカルの単一複合体用GUI、ホスト型のHugging Face Spacesインターフェース、およびドキュメントで説明されているCondaとDockerのセットアップ手順を提供します。
  • PDBBind、DockGen、PoseBustersを対象とするベンチマーク評価ワークフローを説明しています。これにはキャッシュ済みESM2埋め込みの準備も含まれます。

用途

  • 評価案:薬物様リガンドとタンパク質構造に対する結合ポーズ候補を生成し、そのポーズと信頼度スコアを確認する。
  • 評価案:CSVベースの推論で一連のタンパク質–リガンドペアを処理し、研究用ドッキングワークフローへの適合性を評価する。
  • 評価案:ESMFoldで生成したタンパク質構造を用いて配列ベースのドッキングを試し、非結合構造に関するREADMEの注意点を考慮する。
  • 評価案:予測構造を、別個の親和性スコアリングまたは自由エネルギーワークフローの初期入力として用いる。著者の推奨に従い、構造の緩和を行う。

使い方

  1. 公式リポジトリのドキュメントを読み、特に推論とFAQのセクションを確認します。デフォルトのDiffDock-Lモデルを使うか、リポジトリの履歴で説明されているオリジナルのモデルを使うかを決めます。
  2. 単一複合体で初めて試す場合は、リンク先のHugging Face Spacesインターフェースを使用します。ローカルで実行する場合は、READMEのCondaまたはDockerのセットアップ手順に従います。READMEにはローカルGUIについても記載されています。
  3. タンパク質の.pdbファイルまたはESMFoldに渡す配列と、リガンドのSMILES文字列またはRDKitで読み取り可能なファイルを用意します。複数の複合体を扱う場合は、ドキュメントに記載されたCSVのフィールドに従い、data/protein_ligand_example.csvを参照します。
  4. リポジトリの推論例に従って、設定、入力、出力ディレクトリを選択します。初回の分布テーブルのキャッシュに留意してください。READMEでは、利用可能な場合にGPUで実行することを推奨しています。
  5. FAQの注意事項を踏まえて、予測構造と信頼度スコアを確認します。下流の親和性ワークフローを計画する場合は、信頼度を親和性とみなさず、構造の緩和と別個のスコアリング法を評価します。ベンチマーク評価については、リポジトリのデータセットおよび再現に関するセクションを参照します。

関連リソース

AIDDISON Explorer

プラットフォーム

AIDDISON Explorerは、目標プロファイル、設計上の制約、予測物性、合成可能性に基づいて分子候補を生成し、順位付けするホスト型創薬プラットフォームです。

分子生成 · 創薬

AutoDock Vina

オープンソース

AutoDock Vinaは、VinaおよびAutoDock4.2スコアリング、複数リガンドのドッキング、マクロサイクル対応、Python 3バインディングを備えたオープンソースの分子ドッキング・バーチャルスクリーニングプログラムです。

オープンソースPython

創薬

Boltz

モデル

Boltz は生体分子相互作用の予測モデル群です。Boltz-2 は複合体構造と結合親和性の予測手順を提供します。

オープンソースPython

創薬

ChEMBL MCP (cyanheads) は、MCP クライアントを ChEMBL の化合物、標的、生物活性、医薬品の記録に接続し、構造検索と、オプションで DuckDB を用いた大規模な活性データセットの分析を提供します。

オープンソースTypeScript

創薬 · 科学データ

ChEMBL データとケモインフォマティクスサービスのクエリに使用する、ChEMBL グループが保守する公式 Python クライアント。QuerySet 形式のフィルター、遅延取得、ローカルでの結果キャッシュを備えています。

オープンソースPython

創薬 · 科学データ

Chemistry42

プラットフォーム

Chemistry42 は、生成的設計、逆合成、ADMET と選択性の予測、物理ベースの優先順位付けを組み合わせた小分子創薬プラットフォームで、ヒット同定とリード最適化を支援します。

分子生成 · 創薬

関連ガイド

エージェント

化学AIエージェント入門:チャットから研究ワークフローへ

化学および生物医学研究向けの8つのエージェントを取り上げる実践ガイドです。ツール、メモリ、計画、多エージェントの役割の仕組み、タスク別に適したプロジェクト、科学的監督のもとで限定的な自律性を評価する方法を解説します。

ワークフロー

AI創薬ツール:Agents・MCP・研究プラットフォームの選び方

ワークフローの段階に応じてツールを選択します。標的の根拠、タンパク質構造、既知の結合部位、分子生成、特性解析、スクリーニングを対象に、研究用エージェント、MCP連携、ホスト型API、プラットフォームを比較し、提案するエンドツーエンドの例と実践的な評価ゲートを示します。

ワークフロー

タンパク質・構造生物学のAIワークフロー:UniProt・RCSB PDB・Agent

タンパク質の同定情報と配列から、RCSB の構造メタデータ、観察されたリガンド接触、提案する下流候補評価まで、証拠に基づくタンパク質ワークフローを構築します。生物種、アイソフォーム、鎖、欠損データ、実験的検証について明示的に確認します。