出典記録から始める
化学データセットを統合する前に、各入力が何を表し、どこから来たのかを明確にします。ダウンロード場所だけでは不十分です。ミラー、処理済みアーカイブ、元のリリースには、関連していても異なるレコードが含まれている場合があります。
入力アーティファクトごとにマニフェスト項目を作成します。発行元、データセット名、リリース識別子、ソース URL、アクセス日、ファイル名、チェックサムを記録します。入手できる場合は公開日も記載し、情報が欠けている場合は推測せず不明と記します。そのアーティファクトが元のリリースか派生物かを特定し、関連する引用情報をデータとともに保持します。
**入力:**ダウンロードしたファイル、ソース文書、入手可能なリリースメタデータ。**出力:**各アーティファクトをその出所および判明している上流リリースに結び付けるマニフェスト。
判断するための問い:他の人が同じアーティファクトを取得できますか?処理後の各行を元のレコードまでたどれますか?リリース識別子が入手できない場合、このダウンロードと後続のものを区別する証拠は何ですか?
データの権利とコードライセンスを分ける
データセットのライセンスとアクセス条件は、リポジトリのライセンスとは別に確認します。関連する条項またはその所在、適用対象となる素材、再配布、商用利用、派生物に関する未解決の疑問を記録します。公開ダウンロード可能なデータであっても、想定されるすべての利用が許可されているとは限りません。
リンク先のリソースの参照情報は、この区別が重要である理由を示しています。
- Therapeutics Data Commons は MIT コードライセンスについて説明していますが、データセットの利用権は個別に確認する必要があります。
- Open Reaction Database は、データセットのライセンスとリポジトリコードのライセンスを区別しています。
- SPICE は、データセットの利用条件を CC0 と説明し、リポジトリの MIT ライセンスとは別に扱っています。選択したリリースについて、そのソースの記述を記録し、無関係な入力にまで適用しないでください。
予定している各操作について、次の点を確認します。この素材をダウンロード、変換、学習に使用、再配布することは許可されていますか?証拠から答えが得られない場合は、不確実性を記録して確認を求めます。出典チェックリストは法的判断ではありません。
識別子、単位、科学的意味を検証する
正規化したフィールドを作成する前に、ソースの識別子と元の値を保持します。変換に失敗したものや一致が曖昧なものも含め、元のレコードと処理後のレコードの対応関係を維持します。
単位、欠損値の規約、実験条件、計算方法を確認します。プロパティ名が同じでも、ラベルが相互に置き換え可能であるとは限りません。同様に、分子の結合関係が一致しても、2つの配座や測定値が重複しているとは限りません。
リソース固有の詳細が対応付けに影響する場合があります。Open Reaction Database はシリアライズされた反応レコードを Parquet ファイルに格納しており、リンク先の参照情報では reaction_id 列が正式な識別子とされています。また、統合後のデータセット ID を対応付ける retired_datasets.csv についても説明されています。古い参照情報を処理する際は、これらの関係を保持してください。
計算ラベルについては、プログラム、理論手法、入手可能な設定を記録します。SPICE は、互換性のある参照計算を生成する際、理論レベルを一致させるだけでは不十分であり、プログラムと設定も一致させる必要があると明確に注意しています。
**出力:**未解決のレコードを黙って上書きせずに一覧化した、スキーマ辞書、識別子対応表、検証レポート。
表現形式、カバレッジ、重複を確認する
レコード数を数える前に、分析単位を選びます。分子、配座、反応、測定値、分子クラスタのいずれかです。次に、元素、電荷状態、分子クラス、ターゲット範囲、測定プロトコルなど、想定するタスクに関連するカバレッジを調べます。データやタスクとの関連性がある場合は、人口統計学的なカバレッジも検討します。
GEOM は、エネルギーと統計重みの注釈が付いた分子配座を提供します。リンク先の参照情報によると、MessagePack アーカイブは Python 専用データへの追加内容では更新されません。使用した表現形式を記録してください。リソース名だけでカバレッジが同一だとは判断できません。
完全一致する重複、正規化構造の一致、相関する観測を確認します。行識別子が異なっていても、同一分子の複数の配座や共通のソースから得た測定値は、パーティション間でデータリークを生じさせる可能性があります。科学的な問いに適したグループ化規則を選び、曖昧なケースは確認できるよう残します。
Matbench について、リンク先の参照情報から確認できるのは、材料科学の13タスクで構成されるスイートであることまでであり、各タスクの入力スキーマや分割の詳細は確認できません。あるタスクを別のデータセットと互換性があるとみなす前に、リンク先の文書を確認してください。
すべての変換にバージョンを付ける
処理済みの各リリースとともに、解析コード、設定、チェックサム、上流リリース識別子を保管します。フィルタリング規則、単位変換、識別子の正規化、ラベル変換、パーティション割り当てを記録します。規則を改訂しても元の証拠が失われないよう、生の入力は別に保持します。
各段階の入力数と出力数、および除外理由を記録します。件数は処理上の誤りを見つけるのに役立ちますが、科学的な正しさを示すものではありません。ソース識別子にひも付けた簡潔な判断ログを使い、手作業による判断を再現可能にします。
Therapeutics Data Commons は、ローダー、処理関数、設定可能な分割方法について説明しており、scaffold split の例も含まれています。これらの機能はデータ準備に役立ちますが、ユーザーは選択したデータセット、パラメータ、返されたパーティションを記録する必要があります。機能が文書化されていることは、特定のワークフローが正常にテストされた証拠ではありません。
計画例:配座ソースを比較する
**仮定上のシナリオ:**あるチームが、GEOM と SPICE を分子エネルギー学習研究に利用できるか検討しようとしています。これは提案する評価計画であり、テスト済みの統合ではありません。
- 各リソースから具体的なアーティファクトを1つ選び、そのリリース、表現形式、チェックサム、利用条件に関する証拠を記録します。
- 少数のサンプルを確認し、分子キー、配座座標、エネルギーフィールド、単位、計算の来歴を特定します。
- 分子の同一性と配座の同一性を分けた対応表を作成します。重複している可能性のある分子には印を付けますが、形状が一致すると決めつけないでください。
- 定義、参照規約、計算設定を評価するまでは、2つのソースのラベルを別々に扱います。
- 分子単位でグループ化したパーティションを提案し、学習前に重複を定量化します。関連レコードが複数のパーティションにまたがる場合は、分割方法を再検討します。
計画の成果物は互換性表と実施可否の判断であり、統合済みの学習セットではありません。ラベルの比較可能性が未解決のままであれば、ソースを個別に評価するか、問いの範囲を絞ってください。どちらのリソースもエネルギーを提供しているという理由だけで、エネルギー値をまとめてはいけません。
制約と未解決の判断事項を伝える
データの出所、利用条件に関する証拠、変換、除外項目、分割ロジック、既知のカバレッジ不足を説明するデータステートメントを公開します。引用情報と訂正を受け付ける方法も記載します。ソースに記述された機能、実施を提案する確認事項、チームが実際に完了した確認事項を区別します。
出典の追跡によって、ラベルの正確性、モデル性能、臨床その他の重大な用途への適合性が認証されるわけではありません。処理パイプラインを再現可能にしても、観測の少なさ、プロトコルの違い、権利の不確かさは制約として残ります。
実行可能なチェックリストと次のステップ
- 各アーティファクトの出所、リリース、チェックサムを記録する。
- データセットの利用条件とコードライセンスを分けて扱う。
- 元の識別子、値、計算の背景を保持する。
- 分割前に曖昧な一致や相関するレコードを確認する。
- 変換にバージョンを付け、未解決の判断事項を記録する。
候補となる入力や評価上の問いを見つけるには、リソースを閲覧し、科学タスクを閲覧してください。リリース固有の詳細はソースリンクで確認してください。このガイドは科学的性能や互換性を認証するものではありません。