概要
MolScribe は画像からグラフへのモデルを用いて、分子画像から化学構造を認識します。化学文書処理ワークフローにおける構造認識段階を担い、分子図を入力すると、予測インターフェースが構造化された化学表現を返します。リポジトリには Python パッケージ、ダウンロード可能なモデルチェックポイント、予測例、トレーニングおよび評価用リソースが用意されています。リンク先の HuggingFace デモも、モデルを試す別の方法を提供します。
ドキュメントに記載された予測 API は、SMILES と molfile の表現を含む辞書を返します。オプションの出力には、全体の信頼度、原子記号と座標、結合の種類と端点インデックス、原子および結合単位の信頼度が含まれます。クイックスタートの例ではチェックポイントを読み込み、CPU 上で画像ファイルを予測します。このアーキテクチャは Swin-B 画像エンコーダーと 6 層の Transformer デコーダーを使用し、入力サイズは 384×384 と記載されています。
研究ワークフロー向けに、README は USPTO と PubChem 由来のトレーニングデータセットに加え、合成、実環境風、摂動画像のベンチマークを案内しています。また、トレーニングスクリプトと、予測 CSV ファイルを参照構造と比較する単体の評価ツールについても説明しています。評価では、canonical SMILES の完全一致、四面体キラリティーを無視したグラフ完全一致、キラル分子の完全一致を区別します。
これらのリソースは、選択した画像コレクションにおける認識性能の評価に役立ちますが、出典の抜粋からは、特定の導入環境や文書種別における精度は確認できません。MolScribe は分子画像認識ツールとして紹介されており、反応図の解析や、より広範な文献情報の抽出は別プロジェクトとしてリンクされています。リポジトリの MIT コードライセンスを、チェックポイントやデータセットの利用条件の根拠として扱うべきではありません。
主な機能
- 分子画像ファイルから化学構造を予測する画像からグラフへの機能。SMILES と molfile を出力します。
- 原子座標、結合の種類、端点となる原子のインデックスを含む、任意の原子・結合レコード。
- 予測全体と個々の原子および結合について、信頼度を任意で出力。
- Python インターフェース、スクリプト、Jupyter notebook を通じて利用できるダウンロード可能なチェックポイントと予測例。
- USPTO と PubChem のトレーニングデータ、および合成、実環境風、摂動画像のベンチマークを対象とするトレーニング・評価用リソース。
- canonical SMILES、グラフ、キラル構造の完全一致スコアを報告する、CSV ベースの単体評価ツール。
用途
- 評価案:文献処理パイプラインの分子図画像を候補 SMILES および molfile に変換し、後続の確認に用いる。
- 評価案:原子座標と結合の接続情報を使い、元の分子図と照らして認識エラーを調べる。
- 評価案:ドキュメントに記載された評価ツールを用いて、合成、実環境風、または摂動画像のコレクションで予測と参照構造を比較する。
- 評価案:リンク先のデータセットとチェックポイントを使って、ドキュメントに記載されたトレーニングワークフローを再現または拡張する。
使い方
- 公式 READMEを読み、クイック予測ワークフローと、個別のトレーニングまたは評価環境のどちらを使うか選びます。リンク先のデモも別の開始方法です。
- ドキュメントに記載されたパッケージのインストール手順に従います。setup.pyに記載された Python の要件と依存関係を、利用予定の環境に照らして確認してください。これらの記載は、互換性がテスト済みであることの証明ではありません。
- HuggingFace Hubからチェックポイントを取得します。選択した README の例に対応するチェックポイントを使い、クイックスタートの例と実験例で同じものが使われていると決めつけないでください。
- README の画像ファイル予測例に従います。必要に応じて原子・結合レコードと信頼度情報を要求し、返された SMILES、molfile、グラフの詳細を入力画像と照合します。
- 評価を行う場合は、
image_idの値が一致する予測用 CSV と参照用 CSV を用意します。README の単体評価手順に従い、ドキュメントに記載された予測列を選択して、3 種類の完全一致指標をそれぞれ解釈します。