概要
Therapeutics Data Commons (TDC) は、治療法の発見と開発における機械学習向けに、データセットと評価ワークフローを整理しています。文書に記載された対象範囲には、標的の発見、活性スクリーニング、有効性、安全性、製造が含まれ、小分子、抗体、ワクチンなどの生物医学製品を扱います。このリソースは、データセットへのアクセスと、モデルの開発や比較を支援するツールを組み合わせたものであり、単一の予測モデルではありません。
TDC はリソースを問題、学習タスク、データセットに分類しています。問題カテゴリでは、個々の生物医学的エンティティの予測、複数のエンティティに関わる予測、新たなエンティティの生成を区別します。研究者は Python API を介してタスクとデータセットを選び、対応する形式でデータを取得し、訓練・検証・テスト用の分割を利用できます。README には、ADME データセット HIA_Hou を読み込み、dataframe を返し、scaffold split を構築する例が示されています。評価ユーティリティは参照ラベルとモデル予測を受け取り、選択した指標を計算します。分子生成オラクルは、入力された分子のスコアを返します。
研究ワークフローでは、TDC を独自に開発するモデルのデータ準備・評価レイヤーとして利用できます。処理関数は、ラベル変換、バランス調整、負例サンプリング、グラフの準備をカバーしています。また、テーマ別ベンチマークグループは、ADMET タスクを含む関連データセット間の比較を支援します。README からは、シングルセルリソース、PrimeKG、外部 API、モデルハブに関するチュートリアルにもリンクされています。
プロジェクトの README では、このパッケージはベータ版と説明されています。データセットの取得はホスティング状況にも左右されます。多くのデータセットは Harvard Dataverse に置かれており、同サービスのメンテナンスによってアクセスが中断する可能性があります。コードに MIT ライセンスが適用されていることは、データセットの利用権を定めるものではありません。利用権はデータセットごとに確認する必要があります。文書に記載されたベンチマーク機能は、特定のモデルが臨床利用に適している証拠と解釈すべきではありません。
主な機能
- 階層型 Python データローダーにより、予測または生成の問題、治療学習タスク、データセットごとにアクセスを整理できます。
- データ分割では、分割方法、乱数シード、比率を設定できます。文書には scaffold split の例も記載されています。
- 評価ユーティリティは、参照ラベルとモデル予測から ROC-AUC などのタスク指標を計算します。
- データ処理関数には、ラベル変換、バランス調整、負例サンプリング、PyG/DGL グラフの準備が含まれます。
- 分子生成オラクルは、目標指向型および分布学習型のワークフローをサポートし、文書には GSK3B oracle の例が示されています。
- テーマ別ベンチマークグループは、データセットへのアクセス、複数回の実行にわたる予測評価、リーダーボードへの提出ワークフローを提供します。
用途
- 評価案:scaffold split を用いて ADME データセット上の分子特性予測モデルを比較し、未見化合物への汎化性能を調べる。
- 評価案:文書に記載された分割と評価のワークフローを使い、ADMET_Group ベンチマーク全体でモデルを評価する。
- 評価案:生成実験中に TDC の分子生成オラクルを使って候補分子をスコアリングする。ただし、オラクルのスコアを実験的検証とみなさない。
- 評価案:文書に記載された PyG/DGL 処理関数を使い、グラフ学習実験向けに治療分野のデータセットを準備する。
使い方
タスクとデータセットの概要を確認し、治療に関する問いを選んだうえで、関連データセットの説明、原著論文、データセット固有のライセンスを確認します。
リポジトリの READMEにあるインストール手順に従います。README ではパッケージ名を PyTDC とし、リリースはベータ版と説明されています。API の使用方法についてはドキュメントを参照してください。
文書に記載されたローダーの使い方で、選択したデータセットを取得します。モデリングの前に、返されたデータを確認してください。README では、訓練済み予測器ではなく、HIA_Hou を dataframe として取得する例が示されています。
データ分割ガイドを参考に、適切な分割方法を選びます。比較条件をそろえるため、分割方法、シード、比率を記録してください。
独自のモデルを訓練し、評価ガイドに従って関連指標を計算します。グループ比較や提出を行う場合は、ベンチマーク概要に従ってください。
データを取得できない場合は、Harvard Dataverseの稼働状況を確認してください。README では、同サービスのメンテナンスがアクセス中断の原因となり得るとされています。