概要
PubChemPy は PubChem PUG REST API にアクセスするための Python インターフェースを提供します。独立した化学データベースや予測モデルを提供するのではなく、Python の化学データワークフローを PubChem の検索や化合物情報に接続する役割を担います。README には、化学物質名、部分構造、類似性による検索に加え、化学物質の標準化、ファイル形式の変換、構造描画、特性取得が記載されています。
提示された例では、PubChem Compound Identifier(CID)を使った化合物の取得と、名前による検索という2つの利用方法が示されています。CID を使った検索では化合物オブジェクトが返され、その属性から SMILES や IUPAC 名などの情報を参照できます。名前検索の例では化合物の結果一覧が返され、最初の結果の SMILES と分子量を読み取ります。これらの例は、識別子や名前を Python で扱える構造化情報に変換する方法を示しています。
データ準備ワークフローでは、PubChemPy を化学物質のクエリ一覧と後続処理の間に置く検索レイヤーとして利用できます。推奨する評価用途には、PubChem の特性情報でレコードを補完することや、名前検索の結果が目的の化合物を特定しているかを確認することが含まれます。こうした用途では返されたレコードの確認が必要です。README で検索結果の最初の項目を使っているのは一例であり、すべての名前が一意かつ適切に解決されることを示すものではありません。
プロジェクトのメタデータには Python >=3.10 と、必須パッケージ依存関係がないことが記載されています。提示された抜粋からは、サービスの可用性、検索スループット、データベースの網羅範囲、返されるレコードの科学的検証については確認できません。また、より広範な操作も列挙されていますが、詳細な入力と出力は示されていません。そのため、これらのワークフローを計画する際には、リンク先のガイドと API リファレンスを参照してください。
主な機能
- 名前、部分構造、類似性に基づいて PubChem の化学物質を検索します。
- `Compound.from_cid` を使って CID から化合物レコードを取得します。
- ドキュメントの例では、SMILES、IUPAC 名、分子量などの化合物属性を参照できます。
- PubChem インターフェースを介した化学物質の標準化をサポートします。
- README に記載された化学ファイル形式の変換と構造描画機能を提供します。
用途
- 評価案:PubChem CID を含む化学物質インベントリに SMILES と IUPAC 名を追加し、取得したレコードが目的の物質に対応するか確認する。
- 評価案:化学物質名から PubChem の候補レコードを解決し、下流のデータ準備で分子量を使う前に結果の選択を確認する。
- 評価案:化学情報学ワークフロー用の候補化合物セットの作成に、ドキュメントに記載された部分構造検索や類似性検索が適するか評価する。
- 評価案:代表的な化学入力を用い、API ドキュメントを参照して標準化、形式変換、構造描画のワークフローを検討する。
使い方
- リポジトリの READMEを確認し、CID による取得、名前検索、またはその他の記載された操作から選びます。例を選ぶ前に、ワークフローで必要な化合物属性を明確にしてください。
- インストールガイドを参照し、宣言されている Python >=3.10 の要件を確認します。README には pip と conda によるインストール方法が記載されています。記載された手順に従い、根拠のないフラグを追加しないでください。
- 入門ガイドに従います。初期評価では、README の CID 1423 の検索、または Aspirin の名前検索のいずれかを再現し、返された属性を確認してください。
- API リファレンスを使って、部分構造検索、類似性検索、標準化、変換、構造描画の入力と出力を調べます。提示された抜粋には、これらの操作の詳細な手順は記載されていません。
- 検索処理をより大きなワークフローに組み込む前に、代表的なレコードを評価します。化合物の同一性と必要なフィールドを確認し、解決できなかったクエリを記録してください。予期しない動作を調べる際は、課題トラッカーを参照してください。