本文へスキップ

Open Reaction Database

Open Reaction Database Project Authors

Open Reaction Database は、Protobuf レコードを含む Parquet ファイル形式の構造化反応データセットを提供します。また、ミラーからのダウンロードと、ストリーミングアクセスやテキストまたは JSON への変換に対応する ord_schema ワークフローを利用できます。

掲載情報の更新 ·

概要

ord-data を通じて配布される Open Reaction Database (ORD) は、インストール可能なパッケージや予測モデルではなく、反応データのリポジトリです。下流の化学データワークフロー向けに構造化レコードを提供し、データセットのダウンロードと処理を支援するスクリプトも用意されています。GitHub が正式なリポジトリであり、Hugging Face はデータセットオブジェクトの読み取り専用ミラーとして機能します。これには、Git LFS を通じて自動的に経路設定されるダウンロードも含まれます。

各 Parquet ファイルは1つのデータセットを表し、シリアライズされた反応 Protobuf メッセージが行ごとに格納されています。データセット名、説明、ID はファイルメタデータに保持されます。ドキュメントに記載されている ord_schema.datasets.load_dataset インターフェースは、デフォルトでストリーミングの DatasetView を返すため、必要に応じて反応を読み取れます。レコードの反復、インデックス指定、スライス、ID による反応の取得、ID の列挙、個々の行グループの処理が可能です。Dataset proto に実体化すると、データセット全体の変更やシリアライズが可能になります。例では、読みやすい .pbtxt 出力と、個々の反応を JSON に変換する方法も示されています。

統合にあたっては、表現上の重要な制約に注意が必要です。Dataset.reaction_ids は永続化されず、reaction_id 列が正式な情報源です。また、空のデータセットは書き込めません。インデックスで取得した反応は新たにデシリアライズされたコピーであるため、変更しても保存済みファイルには反映されません。名前が似ている ord_schema.parquet.load_dataset はストリーミングではなく、常にデータを実体化します。古い参照については、retired_datasets.csv が統合後のデータセット ID に対応付けており、USPTO の反応レコードには特許の由来情報が保持されています。データセットのライセンスとリポジトリコードのライセンスは別個のものです。

README では、リポジトリの補助コードに Apache-2.0、データセットとその説明用メタデータに CC-BY-SA-4.0 を指定しています。構成要素を分けて確認し、利用するデータの帰属表示と再配布の条件を確認してください。

主な機能

  • 各 Parquet ファイルに1つのデータセットを格納し、シリアライズされた反応 Protobuf レコードと、データセット単位の名前、説明、ID のメタデータを保持します。
  • 自動設定された Hugging Face ミラーを通じた Git LFS 全体のダウンロードに対応し、付属のヘルパーを使ってデータのみ、または一部のデータをダウンロードできます。
  • ord_schema を通じた、ドキュメントに記載されているストリーミングアクセスを提供します。反復、インデックス指定、スライス、反応 ID による検索、ID のみの列挙が可能です。
  • 行グループの反復処理を提供し、`(reaction_id, Reaction)` の組を返して、大容量ファイルの処理を分割できます。
  • 読みやすい `.pbtxt` への変換と、個々の反応メッセージを JSON に変換する方法を説明しています。
  • 廃止されたデータセット ID を統合後の代替データセットに対応付け、USPTO データでは反応ごとの特許由来情報を保持します。

用途

  • 評価案:代表的な反応レコードを確認し、選択したデータセットが反応予測の学習またはベンチマークのワークフローに適しているか判断します。
  • 評価案:行グループを使った抽出パイプラインを構築し、ストリーミングアクセスがローカル環境のメモリおよび処理要件を満たすか確認します。
  • 評価案:選択したレコードを JSON または `.pbtxt` に変換し、スキーマを確認して下流の化学データツールとの統合に役立てます。
  • 評価案:古いデータセット参照を統合後の ID に対応付け、追跡可能性のために USPTO の特許由来情報を確認します。

使い方

  1. リポジトリの READMEを読み、必要なデータセットを特定します。ord-data はインストールするパッケージではなく、データリポジトリとして扱ってください。
  2. Git LFS を使ってリポジトリ全体にアクセスするか、Hugging Face ミラーを参照します。選択的にダウンロードする場合は、データ全体を取得せず、README に記載されたヘルパースクリプトの手順に従ってください。
  3. 選択した Parquet ファイルについて、ドキュメントにある ord_schema の読み込み例に従います。まずデフォルトのストリーミングビューを使い、そのメタデータ、レコード数、代表的な反応を確認します。
  4. ワークフローに応じて、反復、ID 検索、または行グループ処理を選びます。データセット全体の変更またはシリアライズが必要な場合に限り、Dataset proto に実体化します。.pbtxt または JSON を出力する場合は、ドキュメントの例を使用します。
  5. 再配布または提出の前に、データセットライセンス、利用規約、および該当する場合は提出ワークフローを確認してください。

関連リソース

Benchling MCP (longevity-genie) は、API認証情報を使用してAIクライアントをBenchlingのノートブック項目、生物学的配列、プロジェクト、エンティティ検索に接続するPython製MCPサーバーです。

オープンソースPython

ラボ自動化 · 科学データ

ChEMBL MCP (cyanheads) は、MCP クライアントを ChEMBL の化合物、標的、生物活性、医薬品の記録に接続し、構造検索と、オプションで DuckDB を用いた大規模な活性データセットの分析を提供します。

オープンソースTypeScript

創薬 · 科学データ

ChEMBL データとケモインフォマティクスサービスのクエリに使用する、ChEMBL グループが保守する公式 Python クライアント。QuerySet 形式のフィルター、遅延取得、ローカルでの結果キャッシュを備えています。

オープンソースPython

創薬 · 科学データ

Materials Project

プラットフォーム

計算構造や物性を検索し、材料探索と機械学習研究の参照データを準備する学術データプラットフォーム。

材料探索 · 科学データ

Materials Project API は mp-api として公開されている Python クライアントプロジェクトです。公式のデータアクセス文書と任意の MCP サーバーのエントリーポイントが、パッケージ設定で宣言されています。

オープンソースPython

材料探索 · 科学データ

mp_api を介して Materials Project とアシスタントクライアントを接続し、材料検索、結晶構造、電子物性などの材料データを扱うサードパーティ製 MCP サーバーです。

オープンソースPython

材料探索 · 科学データ

関連ガイド

データセット

化学AIデータセットの出典とライセンス

データを統合したりモデル評価を設計したりする前に、化学データセットの出所、利用条件、識別子、変換過程を追跡できる監査可能な記録を作成します。