概要
TANKBindは、NeurIPS 2022の論文 “TANKBind: Trigonometry-Aware Neural NetworKs for Drug-Protein Binding Structure Prediction” に付随するものです。このリポジトリは、論文の結果の再現と、モデルを基盤とするさらなる研究を支援することを目的としています。文書に記載された予測対象はタンパク質–リガンド結合構造と結合親和性であり、実験的な結合アッセイではなく、計算創薬ワークフローの予測コンポーネントとして位置付けられています。
プロジェクトのREADMEでは、実際の作業がノートブック単位で整理されています。構造予測の例では、PDB: 6HD6で識別されるABL1とImatinibおよびcompound6を使用します。ほかのノートブックでは、PDBbindの学習用・テスト用データセットの構築、セルフドッキング評価、LRRK2のWDRドメインを対象としたハイスループット・バーチャルスクリーニングを扱います。ワークフローの概要として、モデルはタンパク質とリガンドの情報を入力として結合予測を出力しますが、抜粋には完全な入力スキーマ、前処理要件、出力ファイル形式は記載されていません。例を改変する前に、ノートブックで詳細を確認する必要があります。
インストール案内では、Pythonベースの環境、PyTorch、複数の科学計算用依存関係に加え、外部からのp2rankのダウンロードが挙げられています。また、GPUに応じてCUDAツールキットの選択を調整する必要がある場合があると記載されています。READMEは、新しいモデルを利用するための別個のアカウント制サービスを案内しているため、そのサービスをリポジトリの実装と同一のものとして扱うべきではありません。報告されているスクリーニングのスループットは情報源による主張であり、別のデータセットやハードウェア構成で独立に確立されたベンチマークではありません。
主な機能
- タンパク質–リガンド結合構造と結合親和性を予測します。
- PDB: 6HD6で識別されるABL1、Imatinib、compound6を用いた構造予測ノートブックを提供します。
- 論文のセルフドッキング・テストセット評価を再現するためのノートブックを含みます。
- PDBbindの学習用・テスト用データセットを構築するノートブックと、文書化されたモデル学習の呼び出し方法を提供します。
- LRRK2のWDRドメインを対象とするハイスループット・バーチャルスクリーニングのノートブックを含みます。
用途
- 評価案:ABL1の例を使い、文書化された構造予測ワークフローを研究対象のタンパク質–リガンドペアに適用できるか評価します。
- 評価案:文書に記載されたデータセットを再構築してセルフドッキングのノートブックを実行し、論文の評価の再現性を調べます。
- 評価案:LRRK2 WDRスクリーニングのノートブックを、計算による候補優先順位付けの出発点として検討し、想定するワークロードでスループットと予測の有用性を測定します。
使い方
- 公式READMEを読み、構造予測、セルフドッキング評価、データセット構築、バーチャルスクリーニングから選択します。リポジトリのワークフローと、リンク先のアカウント制サービスは区別して扱ってください。
- READMEの環境構築手順に従います。Python 3.8と科学計算用依存関係が指定されており、GPUに応じてCUDAツールキットの選択を調整するよう案内されています。これらの説明は、ほかの構成との互換性を示すものではありません。
- 文書に記載されたp2rankのダウンロードを確認し、研究データを準備する前に、選択したノートブックで実際の入力要件と前処理要件を調べます。
- ABL1の例には
examples/prediction_example_using_PDB_6hd6.ipynbから、スクリーニングのワークフローにはexamples/high_throughput_virtual_screening_LRRK2_WDR.ipynbから取りかかります。いずれの例も改変する前に、生成された出力を確認してください。 - 再現を試みる場合は、まず
examples/construction_PDBbind_training_and_test_dataset.ipynb.ipynbを確認し、続いてexamples/testset_evaluation_cleaned.ipynbを確認します。ローカルの設定と実測結果を記録し、READMEに報告されたスループットが自分の環境でも得られると仮定しないでください。