本文へスキップ

Therapeutics Data Commons

PyTDC Team

Therapeutics Data Commons は、治療分野の機械学習データセット、Python ローダー、データ分割、評価指標、ベンチマークを提供し、予測や分子生成の研究を支援します。

掲載情報の更新 ·

概要

Therapeutics Data Commons (TDC) は、治療法の発見と開発における機械学習向けに、データセットと評価ワークフローを整理しています。文書に記載された対象範囲には、標的の発見、活性スクリーニング、有効性、安全性、製造が含まれ、小分子、抗体、ワクチンなどの生物医学製品を扱います。このリソースは、データセットへのアクセスと、モデルの開発や比較を支援するツールを組み合わせたものであり、単一の予測モデルではありません。

TDC はリソースを問題、学習タスク、データセットに分類しています。問題カテゴリでは、個々の生物医学的エンティティの予測、複数のエンティティに関わる予測、新たなエンティティの生成を区別します。研究者は Python API を介してタスクとデータセットを選び、対応する形式でデータを取得し、訓練・検証・テスト用の分割を利用できます。README には、ADME データセット HIA_Hou を読み込み、dataframe を返し、scaffold split を構築する例が示されています。評価ユーティリティは参照ラベルとモデル予測を受け取り、選択した指標を計算します。分子生成オラクルは、入力された分子のスコアを返します。

研究ワークフローでは、TDC を独自に開発するモデルのデータ準備・評価レイヤーとして利用できます。処理関数は、ラベル変換、バランス調整、負例サンプリング、グラフの準備をカバーしています。また、テーマ別ベンチマークグループは、ADMET タスクを含む関連データセット間の比較を支援します。README からは、シングルセルリソース、PrimeKG、外部 API、モデルハブに関するチュートリアルにもリンクされています。

プロジェクトの README では、このパッケージはベータ版と説明されています。データセットの取得はホスティング状況にも左右されます。多くのデータセットは Harvard Dataverse に置かれており、同サービスのメンテナンスによってアクセスが中断する可能性があります。コードに MIT ライセンスが適用されていることは、データセットの利用権を定めるものではありません。利用権はデータセットごとに確認する必要があります。文書に記載されたベンチマーク機能は、特定のモデルが臨床利用に適している証拠と解釈すべきではありません。

主な機能

  • 階層型 Python データローダーにより、予測または生成の問題、治療学習タスク、データセットごとにアクセスを整理できます。
  • データ分割では、分割方法、乱数シード、比率を設定できます。文書には scaffold split の例も記載されています。
  • 評価ユーティリティは、参照ラベルとモデル予測から ROC-AUC などのタスク指標を計算します。
  • データ処理関数には、ラベル変換、バランス調整、負例サンプリング、PyG/DGL グラフの準備が含まれます。
  • 分子生成オラクルは、目標指向型および分布学習型のワークフローをサポートし、文書には GSK3B oracle の例が示されています。
  • テーマ別ベンチマークグループは、データセットへのアクセス、複数回の実行にわたる予測評価、リーダーボードへの提出ワークフローを提供します。

用途

  • 評価案:scaffold split を用いて ADME データセット上の分子特性予測モデルを比較し、未見化合物への汎化性能を調べる。
  • 評価案:文書に記載された分割と評価のワークフローを使い、ADMET_Group ベンチマーク全体でモデルを評価する。
  • 評価案:生成実験中に TDC の分子生成オラクルを使って候補分子をスコアリングする。ただし、オラクルのスコアを実験的検証とみなさない。
  • 評価案:文書に記載された PyG/DGL 処理関数を使い、グラフ学習実験向けに治療分野のデータセットを準備する。

使い方

  1. タスクとデータセットの概要を確認し、治療に関する問いを選んだうえで、関連データセットの説明、原著論文、データセット固有のライセンスを確認します。

  2. リポジトリの READMEにあるインストール手順に従います。README ではパッケージ名を PyTDC とし、リリースはベータ版と説明されています。API の使用方法についてはドキュメントを参照してください。

  3. 文書に記載されたローダーの使い方で、選択したデータセットを取得します。モデリングの前に、返されたデータを確認してください。README では、訓練済み予測器ではなく、HIA_Hou を dataframe として取得する例が示されています。

  4. データ分割ガイドを参考に、適切な分割方法を選びます。比較条件をそろえるため、分割方法、シード、比率を記録してください。

  5. 独自のモデルを訓練し、評価ガイドに従って関連指標を計算します。グループ比較や提出を行う場合は、ベンチマーク概要に従ってください。

  6. データを取得できない場合は、Harvard Dataverseの稼働状況を確認してください。README では、同サービスのメンテナンスがアクセス中断の原因となり得るとされています。

関連リソース

DrugAgent (Liu et al.)

エージェント

DrugAgentは、LLMによる計画立案とドメイン知識に基づくコード生成を組み合わせ、創薬分野の機械学習ワークフローを構築・評価する研究用マルチエージェントフレームワークです。

分子特性予測 · 創薬

TorchDrug

オープンソース

TorchDrugは、SMILES入力、グラフ操作、物性予測の構成要素、および複数のCPU/GPUでの実行に対応する、PyTorchベースのグラフ・分子機械学習ツールキットです。

オープンソースPython

分子特性予測 · 創薬

AIDDISON Explorer

プラットフォーム

AIDDISON Explorerは、目標プロファイル、設計上の制約、予測物性、合成可能性に基づいて分子候補を生成し、順位付けするホスト型創薬プラットフォームです。

分子生成 · 創薬

AutoDock Vina

オープンソース

AutoDock Vinaは、VinaおよびAutoDock4.2スコアリング、複数リガンドのドッキング、マクロサイクル対応、Python 3バインディングを備えたオープンソースの分子ドッキング・バーチャルスクリーニングプログラムです。

オープンソースPython

創薬

Boltz

モデル

Boltz は生体分子相互作用の予測モデル群です。Boltz-2 は複合体構造と結合親和性の予測手順を提供します。

オープンソースPython

創薬

ChemBERTa

モデル

ChemBERTa は、化学 SMILES 向けの BERT 類似モデルを提供します。RoBERTa によるマスク言語モデリングのチェックポイントと、事前学習、ファインチューニング、分子特性予測の研究向けノートブックが含まれます。

オープンソースPython

分子特性予測

関連ガイド

概要

化学AIエージェントの技術スタックを構築するには

言語モデル、オーケストレーション、Skills、MCPインターフェース、API、ライブラリ、データを分離して、化学AIエージェントスタックを設計します。提案する分子・材料ワークフローを参考に、入出力契約を定義し、権限、評価、再現可能なデプロイを計画します。

データセット

化学AIデータセットの出典とライセンス

データを統合したりモデル評価を設計したりする前に、化学データセットの出所、利用条件、識別子、変換過程を追跡できる監査可能な記録を作成します。