概要
DiffDockは、低分子がタンパク質に結合した状態の三次元構造を予測する研究用実装です。分子ドッキングワークフローにおけるポーズ生成段階に対応しており、結合親和性を直接推定するものではありません。プロジェクトのREADMEによると、このリポジトリではデフォルトでDiffDock-Lが実行されます。オリジナルのDiffDockモデルを利用したい場合は、リポジトリの履歴を確認するよう案内されています。
入力には、.pdb形式のタンパク質構造と、SMILES文字列またはRDKitで読み取り可能な.sdfや.mol2などのファイルで表したリガンドを組み合わせられます。また、タンパク質配列を入力すると、ワークフロー内でESMFoldを用いて折りたたみます。個々の複合体は直接指定でき、複数のタンパク質–リガンドペアを記述したCSVを使ってバッチ推論を行うこともできます。出力には予測された結合構造と信頼度スコアが含まれます。リポジトリには単一複合体用のローカルGUIも記載されており、ホスト型のHugging Face Spacesインターフェースへのリンクもあります。
信頼度スコアは予測ポーズに対するモデルの確信度を表し、結合親和性を示すものではありません。またREADMEでは、異なる複合体間やタンパク質構造間で単純に比較しないよう注意を促しています。スコアの解釈に関する説明は、学習時の設定に似た入力、すなわち薬物様リガンドと、結合状態に近い構造をとる中型のタンパク質を想定しています。このモデルは低分子のタンパク質へのドッキングを目的としており、より大型の生体分子間の相互作用を対象としていません。下流で親和性を推定する場合、予測構造を緩和してから、別のスコアリング法または自由エネルギー法を適用することを著者は推奨しています。提供された.pdb構造を用いるローカル推論はCPU実行にも対応していますが、READMEではGPUの使用を推奨しています。
主な機能
- タンパク質–低分子複合体構造を予測し、ポーズの信頼度スコアを出力します。現在のリポジトリではデフォルトでDiffDock-Lが使われます。
- タンパク質の`.pdb`ファイル、またはESMFoldで折りたたむタンパク質配列を受け付けます。
- リガンドのSMILES文字列、および`.sdf`や`.mol2`を含むRDKitで読み取り可能な分子ファイルを受け付けます。
- 単一複合体の推論と、タンパク質およびリガンドの入力を含むCSVレコードからのバッチ推論に対応しています。
- ローカルの単一複合体用GUI、ホスト型のHugging Face Spacesインターフェース、およびドキュメントで説明されているCondaとDockerのセットアップ手順を提供します。
- PDBBind、DockGen、PoseBustersを対象とするベンチマーク評価ワークフローを説明しています。これにはキャッシュ済みESM2埋め込みの準備も含まれます。
用途
- 評価案:薬物様リガンドとタンパク質構造に対する結合ポーズ候補を生成し、そのポーズと信頼度スコアを確認する。
- 評価案:CSVベースの推論で一連のタンパク質–リガンドペアを処理し、研究用ドッキングワークフローへの適合性を評価する。
- 評価案:ESMFoldで生成したタンパク質構造を用いて配列ベースのドッキングを試し、非結合構造に関するREADMEの注意点を考慮する。
- 評価案:予測構造を、別個の親和性スコアリングまたは自由エネルギーワークフローの初期入力として用いる。著者の推奨に従い、構造の緩和を行う。
使い方
- 公式リポジトリのドキュメントを読み、特に推論とFAQのセクションを確認します。デフォルトのDiffDock-Lモデルを使うか、リポジトリの履歴で説明されているオリジナルのモデルを使うかを決めます。
- 単一複合体で初めて試す場合は、リンク先のHugging Face Spacesインターフェースを使用します。ローカルで実行する場合は、READMEのCondaまたはDockerのセットアップ手順に従います。READMEにはローカルGUIについても記載されています。
- タンパク質の
.pdbファイルまたはESMFoldに渡す配列と、リガンドのSMILES文字列またはRDKitで読み取り可能なファイルを用意します。複数の複合体を扱う場合は、ドキュメントに記載されたCSVのフィールドに従い、data/protein_ligand_example.csvを参照します。 - リポジトリの推論例に従って、設定、入力、出力ディレクトリを選択します。初回の分布テーブルのキャッシュに留意してください。READMEでは、利用可能な場合にGPUで実行することを推奨しています。
- FAQの注意事項を踏まえて、予測構造と信頼度スコアを確認します。下流の親和性ワークフローを計画する場合は、信頼度を親和性とみなさず、構造の緩和と別個のスコアリング法を評価します。ベンチマーク評価については、リポジトリのデータセットおよび再現に関するセクションを参照します。