本文へスキップ

DeepPurpose

Kexin Huang, Tianfan Fu

DeepPurpose は、化合物およびタンパク質の予測モデルをトレーニングして適用するための PyTorch ベースのツールキットで、薬物-標的相互作用、分子特性、ドラッグリポジショニング、バーチャルスクリーニングのワークフローを備えています。

掲載情報の更新 ·

概要

DeepPurpose は、薬物-標的相互作用予測を中心とする分子モデリングツールキットで、化合物特性、薬物-薬物相互作用、タンパク質-タンパク質相互作用、タンパク質機能に関するモジュールも備えています。単一の予測モデルではなく、設定可能なトレーニングおよび推論フレームワークを提供します。文書化されたワークフローでは、データセットの準備、分子エンコーディング、モデル設定、トレーニング、候補のランキングを連携させ、ドラッグリポジショニングやバーチャルスクリーニングなどの研究用途に対応します。

薬物-標的タスクの入力は、化合物 SMILES、タンパク質のアミノ酸配列、実測結合値または二値ラベルです。他のモジュールでは、化合物のみ、タンパク質のみ、または対応するラベル付きのペア入力を受け付けます。ユーザーはフィンガープリント、記述子、配列、グラフベースのエンコーディングを選択し、トレーニング、検証、テスト用の分割を準備して、モデルを初期化するか、事前学習済みチェックポイントを読み込めます。出力には、予測、トレーニング指標、評価図、ランキングされたドラッグリポジショニング結果が含まれます。データセットローダーは BindingDB、DAVIS、KIBA、Broad Repurposing Hub などのソースに対応しています。これらは上流のデータリソースであり、DeepPurpose が管理するデータベースではありません。

README には、回帰と二値分類、コールドドラッグおよびコールドターゲットの評価設定、ラベルスケール変換、名称が示されたデータセットに関連する事前学習済みモデルが記載されています。また、教育目的の事前学習済みドラッグリポジショニング例は対象範囲が限られており、未知のタンパク質には汎化しない可能性があると注意されています。BindingDB と DAVIS の DTI チェックポイントでは対数スケールのラベルが使用されているため、出力の解釈には変換設定への留意が必要です。プロジェクトはウェットラボでの検証前に専門家が確認することを求め、提案された薬剤をそのまま使用しないよう警告しています。これらの文書化されたワークフローは評価計画の策定を支援するものであり、活性が実験的に確認されたことを示す証拠ではありません。

主な機能

  • 薬物-標的、薬物-薬物、タンパク質-タンパク質の相互作用予測、化合物特性予測、タンパク質機能予測のタスクモジュール。
  • 選択可能な化合物エンコーディングには、Morgan フィンガープリント、rdkit_2d_normalized 記述子、SMILES ベースの CNN、transformer、MPNN、DGL グラフモデルが含まれます。タンパク質エンコーディングには、配列記述子、CNN、transformer が含まれます。
  • データセットローダーとテキストファイルリーダーは、ベンチマーク結合データ、バイオアッセイラベル、カスタム相互作用ペア、ドラッグリポジショニングライブラリ、バーチャルスクリーニング入力に対応します。
  • データ準備ではコールドドラッグおよびコールドターゲット分割に対応し、トレーニング機能には早期停止と分類または回帰の指標が含まれます。
  • 事前学習済みチェックポイントの読み込み、スクラッチからのトレーニング、文書化されたファインチューニングのワークフローにより、ランキング結果を伴うドラッグリポジショニングやバーチャルスクリーニングを支援します。
  • ラベル変換では、事前学習済み DTI 予測の解釈を含め、対数スケールと元の結合値スケールの間で変換できます。

用途

  • 想定される評価用途:文書化されたベンチマークとコールドドラッグまたはコールドターゲット分割を用いて、結合親和性予測における化合物およびタンパク質エンコーディングを比較する。
  • 想定される評価用途:標的タンパク質配列が得られない場合に、ラベル付きスクリーニングデータで化合物特性モデルをトレーニングする。
  • 想定される評価用途:指定された化合物ライブラリを標的配列に対してランキングし、専門家のレビューと実験検証候補の選定に用いる。
  • 想定される評価用途:文書化された入力形式のラベル付きペアを用いて、薬物-薬物またはタンパク質-タンパク質相互作用の分類を検討する。

使い方

  1. リポジトリの READMEから始め、タスクモジュールを選んでその例を確認します。問題に応じて、相互作用の回帰、二値分類、または化合物/タンパク質予測タスクを選びます。
  2. ローカルパッケージのインストールまたはソースベースの環境構築について、README の手順に従います。これは提供されたセットアップ案内であり、使用環境との互換性を確認したものではありません。
  3. DEMO フォルダーのデータ形式の説明とノートブックを参照します。必要に応じて SMILES、タンパク質配列、ラベルを準備し、結合値の単位と対数変換が適切かどうかを確認します。
  4. 文書化されたエンコーディングを選択し、データ分割を設定します。汎化性能を評価する場合は、ランダム分割だけに頼らず、コールドドラッグまたはコールドターゲット分割を検討します。チェックポイントを選ぶ前に、モデルをトレーニングするか、事前学習済みモデルのチュートリアルを確認します。
  5. ドラッグリポジショニングまたはバーチャルスクリーニングを実行する前に、タスクに適した指標と予測スケールを確認します。実験での後続検証に進む前に、ランキング結果を分野の専門家に確認してもらいます。リンク先のドキュメントサイトは、現在も積極的に開発中と説明されています。

関連リソース

AIDDISON Explorer

プラットフォーム

AIDDISON Explorerは、目標プロファイル、設計上の制約、予測物性、合成可能性に基づいて分子候補を生成し、順位付けするホスト型創薬プラットフォームです。

分子生成 · 創薬

AutoDock Vina

オープンソース

AutoDock Vinaは、VinaおよびAutoDock4.2スコアリング、複数リガンドのドッキング、マクロサイクル対応、Python 3バインディングを備えたオープンソースの分子ドッキング・バーチャルスクリーニングプログラムです。

オープンソースPython

創薬

Boltz

モデル

Boltz は生体分子相互作用の予測モデル群です。Boltz-2 は複合体構造と結合親和性の予測手順を提供します。

オープンソースPython

創薬

ChEMBL MCP (cyanheads) は、MCP クライアントを ChEMBL の化合物、標的、生物活性、医薬品の記録に接続し、構造検索と、オプションで DuckDB を用いた大規模な活性データセットの分析を提供します。

オープンソースTypeScript

創薬 · 科学データ

ChEMBL データとケモインフォマティクスサービスのクエリに使用する、ChEMBL グループが保守する公式 Python クライアント。QuerySet 形式のフィルター、遅延取得、ローカルでの結果キャッシュを備えています。

オープンソースPython

創薬 · 科学データ

Chemistry42

プラットフォーム

Chemistry42 は、生成的設計、逆合成、ADMET と選択性の予測、物理ベースの優先順位付けを組み合わせた小分子創薬プラットフォームで、ヒット同定とリード最適化を支援します。

分子生成 · 創薬

関連ガイド

エージェント

化学AIエージェント入門:チャットから研究ワークフローへ

化学および生物医学研究向けの8つのエージェントを取り上げる実践ガイドです。ツール、メモリ、計画、多エージェントの役割の仕組み、タスク別に適したプロジェクト、科学的監督のもとで限定的な自律性を評価する方法を解説します。

ワークフロー

AI創薬ツール:Agents・MCP・研究プラットフォームの選び方

ワークフローの段階に応じてツールを選択します。標的の根拠、タンパク質構造、既知の結合部位、分子生成、特性解析、スクリーニングを対象に、研究用エージェント、MCP連携、ホスト型API、プラットフォームを比較し、提案するエンドツーエンドの例と実践的な評価ゲートを示します。

ワークフロー

タンパク質・構造生物学のAIワークフロー:UniProt・RCSB PDB・Agent

タンパク質の同定情報と配列から、RCSB の構造メタデータ、観察されたリガンド接触、提案する下流候補評価まで、証拠に基づくタンパク質ワークフローを構築します。生物種、アイソフォーム、鎖、欠損データ、実験的検証について明示的に確認します。