概要
ord-data を通じて配布される Open Reaction Database (ORD) は、インストール可能なパッケージや予測モデルではなく、反応データのリポジトリです。下流の化学データワークフロー向けに構造化レコードを提供し、データセットのダウンロードと処理を支援するスクリプトも用意されています。GitHub が正式なリポジトリであり、Hugging Face はデータセットオブジェクトの読み取り専用ミラーとして機能します。これには、Git LFS を通じて自動的に経路設定されるダウンロードも含まれます。
各 Parquet ファイルは1つのデータセットを表し、シリアライズされた反応 Protobuf メッセージが行ごとに格納されています。データセット名、説明、ID はファイルメタデータに保持されます。ドキュメントに記載されている ord_schema.datasets.load_dataset インターフェースは、デフォルトでストリーミングの DatasetView を返すため、必要に応じて反応を読み取れます。レコードの反復、インデックス指定、スライス、ID による反応の取得、ID の列挙、個々の行グループの処理が可能です。Dataset proto に実体化すると、データセット全体の変更やシリアライズが可能になります。例では、読みやすい .pbtxt 出力と、個々の反応を JSON に変換する方法も示されています。
統合にあたっては、表現上の重要な制約に注意が必要です。Dataset.reaction_ids は永続化されず、reaction_id 列が正式な情報源です。また、空のデータセットは書き込めません。インデックスで取得した反応は新たにデシリアライズされたコピーであるため、変更しても保存済みファイルには反映されません。名前が似ている ord_schema.parquet.load_dataset はストリーミングではなく、常にデータを実体化します。古い参照については、retired_datasets.csv が統合後のデータセット ID に対応付けており、USPTO の反応レコードには特許の由来情報が保持されています。データセットのライセンスとリポジトリコードのライセンスは別個のものです。
README では、リポジトリの補助コードに Apache-2.0、データセットとその説明用メタデータに CC-BY-SA-4.0 を指定しています。構成要素を分けて確認し、利用するデータの帰属表示と再配布の条件を確認してください。
主な機能
- 各 Parquet ファイルに1つのデータセットを格納し、シリアライズされた反応 Protobuf レコードと、データセット単位の名前、説明、ID のメタデータを保持します。
- 自動設定された Hugging Face ミラーを通じた Git LFS 全体のダウンロードに対応し、付属のヘルパーを使ってデータのみ、または一部のデータをダウンロードできます。
- ord_schema を通じた、ドキュメントに記載されているストリーミングアクセスを提供します。反復、インデックス指定、スライス、反応 ID による検索、ID のみの列挙が可能です。
- 行グループの反復処理を提供し、`(reaction_id, Reaction)` の組を返して、大容量ファイルの処理を分割できます。
- 読みやすい `.pbtxt` への変換と、個々の反応メッセージを JSON に変換する方法を説明しています。
- 廃止されたデータセット ID を統合後の代替データセットに対応付け、USPTO データでは反応ごとの特許由来情報を保持します。
用途
- 評価案:代表的な反応レコードを確認し、選択したデータセットが反応予測の学習またはベンチマークのワークフローに適しているか判断します。
- 評価案:行グループを使った抽出パイプラインを構築し、ストリーミングアクセスがローカル環境のメモリおよび処理要件を満たすか確認します。
- 評価案:選択したレコードを JSON または `.pbtxt` に変換し、スキーマを確認して下流の化学データツールとの統合に役立てます。
- 評価案:古いデータセット参照を統合後の ID に対応付け、追跡可能性のために USPTO の特許由来情報を確認します。
使い方
- リポジトリの READMEを読み、必要なデータセットを特定します。
ord-dataはインストールするパッケージではなく、データリポジトリとして扱ってください。 - Git LFS を使ってリポジトリ全体にアクセスするか、Hugging Face ミラーを参照します。選択的にダウンロードする場合は、データ全体を取得せず、README に記載されたヘルパースクリプトの手順に従ってください。
- 選択した Parquet ファイルについて、ドキュメントにある
ord_schemaの読み込み例に従います。まずデフォルトのストリーミングビューを使い、そのメタデータ、レコード数、代表的な反応を確認します。 - ワークフローに応じて、反復、ID 検索、または行グループ処理を選びます。データセット全体の変更またはシリアライズが必要な場合に限り、Dataset proto に実体化します。
.pbtxtまたは JSON を出力する場合は、ドキュメントの例を使用します。 - 再配布または提出の前に、データセットライセンス、利用規約、および該当する場合は提出ワークフローを確認してください。