本文へスキップ

PubChemPy

Matt Swain

PubChemPy は PubChem PUG REST API の Python ラッパーで、化学物質の検索、化合物の特性取得、標準化、ファイル形式の変換、構造描画をサポートします。

掲載情報の更新 ·

概要

PubChemPy は PubChem PUG REST API にアクセスするための Python インターフェースを提供します。独立した化学データベースや予測モデルを提供するのではなく、Python の化学データワークフローを PubChem の検索や化合物情報に接続する役割を担います。README には、化学物質名、部分構造、類似性による検索に加え、化学物質の標準化、ファイル形式の変換、構造描画、特性取得が記載されています。

提示された例では、PubChem Compound Identifier(CID)を使った化合物の取得と、名前による検索という2つの利用方法が示されています。CID を使った検索では化合物オブジェクトが返され、その属性から SMILES や IUPAC 名などの情報を参照できます。名前検索の例では化合物の結果一覧が返され、最初の結果の SMILES と分子量を読み取ります。これらの例は、識別子や名前を Python で扱える構造化情報に変換する方法を示しています。

データ準備ワークフローでは、PubChemPy を化学物質のクエリ一覧と後続処理の間に置く検索レイヤーとして利用できます。推奨する評価用途には、PubChem の特性情報でレコードを補完することや、名前検索の結果が目的の化合物を特定しているかを確認することが含まれます。こうした用途では返されたレコードの確認が必要です。README で検索結果の最初の項目を使っているのは一例であり、すべての名前が一意かつ適切に解決されることを示すものではありません。

プロジェクトのメタデータには Python >=3.10 と、必須パッケージ依存関係がないことが記載されています。提示された抜粋からは、サービスの可用性、検索スループット、データベースの網羅範囲、返されるレコードの科学的検証については確認できません。また、より広範な操作も列挙されていますが、詳細な入力と出力は示されていません。そのため、これらのワークフローを計画する際には、リンク先のガイドと API リファレンスを参照してください。

主な機能

  • 名前、部分構造、類似性に基づいて PubChem の化学物質を検索します。
  • `Compound.from_cid` を使って CID から化合物レコードを取得します。
  • ドキュメントの例では、SMILES、IUPAC 名、分子量などの化合物属性を参照できます。
  • PubChem インターフェースを介した化学物質の標準化をサポートします。
  • README に記載された化学ファイル形式の変換と構造描画機能を提供します。

用途

  • 評価案:PubChem CID を含む化学物質インベントリに SMILES と IUPAC 名を追加し、取得したレコードが目的の物質に対応するか確認する。
  • 評価案:化学物質名から PubChem の候補レコードを解決し、下流のデータ準備で分子量を使う前に結果の選択を確認する。
  • 評価案:化学情報学ワークフロー用の候補化合物セットの作成に、ドキュメントに記載された部分構造検索や類似性検索が適するか評価する。
  • 評価案:代表的な化学入力を用い、API ドキュメントを参照して標準化、形式変換、構造描画のワークフローを検討する。

使い方

  1. リポジトリの READMEを確認し、CID による取得、名前検索、またはその他の記載された操作から選びます。例を選ぶ前に、ワークフローで必要な化合物属性を明確にしてください。
  2. インストールガイドを参照し、宣言されている Python >=3.10 の要件を確認します。README には pip と conda によるインストール方法が記載されています。記載された手順に従い、根拠のないフラグを追加しないでください。
  3. 入門ガイドに従います。初期評価では、README の CID 1423 の検索、または Aspirin の名前検索のいずれかを再現し、返された属性を確認してください。
  4. API リファレンスを使って、部分構造検索、類似性検索、標準化、変換、構造描画の入力と出力を調べます。提示された抜粋には、これらの操作の詳細な手順は記載されていません。
  5. 検索処理をより大きなワークフローに組み込む前に、代表的なレコードを評価します。化合物の同一性と必要なフィールドを確認し、解決できなかったクエリを記録してください。予期しない動作を調べる際は、課題トラッカーを参照してください。

関連リソース

PubChem MCP (cyanheads) は MCP クライアントを PubChem の化合物およびバイオアッセイデータに接続し、識別子や構造による検索、物性の取得、安全性記録、相互参照、3D配座に対応します。

オープンソースTypeScript

ケモインフォマティクス · 科学データ

PubChem MCP (PhelanShao) は、AI クライアントが名前または CID で PubChem の化合物特性や構造を取得できる Python MCP サーバーです。JSON、CSV、XYZ 形式での出力に加え、構造ファイルのダウンロードにも対応します。

オープンソースPython

ケモインフォマティクス · 科学データ

PubChem PUG RESTは、選択した化学レコード、物性、アッセイ情報を取得するHTTP APIです。文書で説明されている識別子入力、構造検索、操作ごとの出力形式に対応しています。

ケモインフォマティクス · 科学データ

Scientific Agent Skills は、ケモインフォマティクス、分光学、材料分析などを含む、科学ソフトウェアパッケージ、データベース、研究ワークフローを扱う AI エージェント向けの手順ガイダンスを提供します。

オープンソースPython

ケモインフォマティクス · 科学データ

Benchling MCP (longevity-genie) は、API認証情報を使用してAIクライアントをBenchlingのノートブック項目、生物学的配列、プロジェクト、エンティティ検索に接続するPython製MCPサーバーです。

オープンソースPython

ラボ自動化 · 科学データ

ChEMBL MCP (cyanheads) は、MCP クライアントを ChEMBL の化合物、標的、生物活性、医薬品の記録に接続し、構造検索と、オプションで DuckDB を用いた大規模な活性データセットの分析を提供します。

オープンソースTypeScript

創薬 · 科学データ

対応クライアント

このリソースを使った活用レシピ

公式

化学データ整理スタック

元の行を保持して RDKit で SMILES を検証・標準表現化し、重複を表示します。任意で PubChem 識別子を取得できます。

RDKit + PubChemPy

化学データ処理

難易度: 中級 費用: 無料 プライバシー: 設定に依存 ~30 分

Python

セットアップを見る →

関連ガイド

概要

化学AIエージェントの技術スタックを構築するには

言語モデル、オーケストレーション、Skills、MCPインターフェース、API、ライブラリ、データを分離して、化学AIエージェントスタックを設計します。提案する分子・材料ワークフローを参考に、入出力契約を定義し、権限、評価、再現可能なデプロイを計画します。

APIs

PubChemデータをAIエージェントに接続する

明示的な化合物識別子、上限を設けたツール呼び出し、出典情報の保持、曖昧さ・データ欠落・部分的な結果の確認を組み合わせた、追跡可能なPubChem検索ワークフローを計画します。