概要
DeepPurpose は、薬物-標的相互作用予測を中心とする分子モデリングツールキットで、化合物特性、薬物-薬物相互作用、タンパク質-タンパク質相互作用、タンパク質機能に関するモジュールも備えています。単一の予測モデルではなく、設定可能なトレーニングおよび推論フレームワークを提供します。文書化されたワークフローでは、データセットの準備、分子エンコーディング、モデル設定、トレーニング、候補のランキングを連携させ、ドラッグリポジショニングやバーチャルスクリーニングなどの研究用途に対応します。
薬物-標的タスクの入力は、化合物 SMILES、タンパク質のアミノ酸配列、実測結合値または二値ラベルです。他のモジュールでは、化合物のみ、タンパク質のみ、または対応するラベル付きのペア入力を受け付けます。ユーザーはフィンガープリント、記述子、配列、グラフベースのエンコーディングを選択し、トレーニング、検証、テスト用の分割を準備して、モデルを初期化するか、事前学習済みチェックポイントを読み込めます。出力には、予測、トレーニング指標、評価図、ランキングされたドラッグリポジショニング結果が含まれます。データセットローダーは BindingDB、DAVIS、KIBA、Broad Repurposing Hub などのソースに対応しています。これらは上流のデータリソースであり、DeepPurpose が管理するデータベースではありません。
README には、回帰と二値分類、コールドドラッグおよびコールドターゲットの評価設定、ラベルスケール変換、名称が示されたデータセットに関連する事前学習済みモデルが記載されています。また、教育目的の事前学習済みドラッグリポジショニング例は対象範囲が限られており、未知のタンパク質には汎化しない可能性があると注意されています。BindingDB と DAVIS の DTI チェックポイントでは対数スケールのラベルが使用されているため、出力の解釈には変換設定への留意が必要です。プロジェクトはウェットラボでの検証前に専門家が確認することを求め、提案された薬剤をそのまま使用しないよう警告しています。これらの文書化されたワークフローは評価計画の策定を支援するものであり、活性が実験的に確認されたことを示す証拠ではありません。
主な機能
- 薬物-標的、薬物-薬物、タンパク質-タンパク質の相互作用予測、化合物特性予測、タンパク質機能予測のタスクモジュール。
- 選択可能な化合物エンコーディングには、Morgan フィンガープリント、rdkit_2d_normalized 記述子、SMILES ベースの CNN、transformer、MPNN、DGL グラフモデルが含まれます。タンパク質エンコーディングには、配列記述子、CNN、transformer が含まれます。
- データセットローダーとテキストファイルリーダーは、ベンチマーク結合データ、バイオアッセイラベル、カスタム相互作用ペア、ドラッグリポジショニングライブラリ、バーチャルスクリーニング入力に対応します。
- データ準備ではコールドドラッグおよびコールドターゲット分割に対応し、トレーニング機能には早期停止と分類または回帰の指標が含まれます。
- 事前学習済みチェックポイントの読み込み、スクラッチからのトレーニング、文書化されたファインチューニングのワークフローにより、ランキング結果を伴うドラッグリポジショニングやバーチャルスクリーニングを支援します。
- ラベル変換では、事前学習済み DTI 予測の解釈を含め、対数スケールと元の結合値スケールの間で変換できます。
用途
- 想定される評価用途:文書化されたベンチマークとコールドドラッグまたはコールドターゲット分割を用いて、結合親和性予測における化合物およびタンパク質エンコーディングを比較する。
- 想定される評価用途:標的タンパク質配列が得られない場合に、ラベル付きスクリーニングデータで化合物特性モデルをトレーニングする。
- 想定される評価用途:指定された化合物ライブラリを標的配列に対してランキングし、専門家のレビューと実験検証候補の選定に用いる。
- 想定される評価用途:文書化された入力形式のラベル付きペアを用いて、薬物-薬物またはタンパク質-タンパク質相互作用の分類を検討する。
使い方
- リポジトリの READMEから始め、タスクモジュールを選んでその例を確認します。問題に応じて、相互作用の回帰、二値分類、または化合物/タンパク質予測タスクを選びます。
- ローカルパッケージのインストールまたはソースベースの環境構築について、README の手順に従います。これは提供されたセットアップ案内であり、使用環境との互換性を確認したものではありません。
- DEMO フォルダーのデータ形式の説明とノートブックを参照します。必要に応じて SMILES、タンパク質配列、ラベルを準備し、結合値の単位と対数変換が適切かどうかを確認します。
- 文書化されたエンコーディングを選択し、データ分割を設定します。汎化性能を評価する場合は、ランダム分割だけに頼らず、コールドドラッグまたはコールドターゲット分割を検討します。チェックポイントを選ぶ前に、モデルをトレーニングするか、事前学習済みモデルのチュートリアルを確認します。
- ドラッグリポジショニングまたはバーチャルスクリーニングを実行する前に、タスクに適した指標と予測スケールを確認します。実験での後続検証に進む前に、ランキング結果を分野の専門家に確認してもらいます。リンク先のドキュメントサイトは、現在も積極的に開発中と説明されています。