本文へスキップ

Spec2Vec

Florian Huber / Netherlands eScience Center & Düsseldorf University of Applied Sciences

Spec2Vec は、MS/MS スペクトルの類似度スコアリングを行う Python パッケージです。質量フラグメントと中性脱離から学習した Word2Vec 埋め込みを用いて、クエリスペクトルと参照スペクトルを比較します。

掲載情報の更新 ·

概要

Spec2Vec は、タンデム質量分析スペクトル向けに学習された類似度指標を提供します。Word2Vec に着想を得て、スペクトルコレクション内での出現状況から質量フラグメントと中性脱離の関係を学習し、スペクトル埋め込みを用いて比較します。このリポジトリが提供するのは、単一の固定予測モデルやホスト型スペクトルデータベースではなく、学習とスコアリングのワークフローに使う Python パッケージです。

文書に記載されたワークフローは、matchms を使って MGF ファイルから参照スペクトルを読み込むことから始まります。フィルタリング後、SpectrumDocument はピークを m/z 値に基づくトークンに変換し、小数精度を設定できます。train_new_word2vec_model はこれらのドキュメントからモデルを学習し、後で使用できるよう保存できます。比較時には、学習済みモデルを gensim 経由で読み込み、Spec2Vec に渡します。matchms との連携により、参照スペクトルとクエリスペクトルの組み合わせをスコアリングし、選択したクエリに対してスコアの高い一致候補を取得できます。したがって、出力には保存された Word2Vec モデルと、順位付けされた参照スペクトル候補を伴うスペクトル類似度スコアが含まれます。

モデルの適性は学習データセットに左右されます。意味のある表現を得るため、README は大規模で代表性のあるデータセットを推奨しています。別のコレクションのスペクトルには、モデルの語彙に含まれないピークトークンが含まれることがあるため、スコアリングインターフェースには allowed_missing_percentage が用意されています。例では強度重み付けも設定しています。これらの設定は新しいデータセットを評価する際に関係しますが、出典の抜粋からはベンチマーク性能や同定精度は確認できません。例示されているインポートとフィルタリングの段階は matchms が担います。README は、一部の matchms フィルターに必要な RDKit と Spec2Vec 自体の機能を区別しています。

主な機能

  • MS/MS スペクトル内の質量フラグメントと中性脱離の関係から、Word2Vec ベースの埋め込みを学習します。
  • `SpectrumDocument` を使って、スペクトルを m/z ベースのトークンドキュメントに変換します。小数精度を設定できます。
  • `train_new_word2vec_model` を通じて Word2Vec モデルを学習・保存します。デフォルトの学習パラメーターは上書きできます。
  • 設定可能な `intensity_weighting_power` と `allowed_missing_percentage` を用いて、モデルベースのスペクトル類似度を計算します。
  • matchms と連携し、参照スペクトルとクエリスペクトルの組み合わせをスコアリングして、個々のクエリスペクトルに対する一致候補を順位順に取得します。

用途

  • 想定される評価用途:実験 MS/MS クエリに対して参照ライブラリのスペクトルを順位付けし、スコア上位の一致候補の妥当性を評価する。
  • 想定される評価用途:代表性のある社内スペクトルコレクションで類似度モデルを学習し、関連するクエリデータへの適性を評価する。
  • 想定される評価用途:学習コレクションとクエリコレクションが異なる場合に、未見のピークトークンと欠損トークン許容率が比較に与える影響を調べる。

使い方

  1. ユーザードキュメントとリポジトリ READMEを参照してください。文書に記載された Conda または pip のインストール方法を選択します。RDKit を必要とする matchms フィルターを使う場合は、別途必要となる点に注意してください。
  2. 代表性のある参照スペクトルとクエリスペクトルを準備します。matchms を用いた MGF インポートについて、README の例に従い、例示されたフィルタリングパイプラインを適用します。そのパイプラインで除外されたスペクトルは使用しないでください。
  3. 前処理した参照スペクトルを SpectrumDocument オブジェクトに変換します。m/z の小数精度は、学習に使用するピークトークン表現を決めるため、慎重に選択してください。
  4. train_new_word2vec_model を使ってモデルを学習・保存するか、ワークフロー向けに以前学習したモデルを gensim 経由で読み込みます。README は大規模で代表性のある学習コレクションを推奨しています。
  5. モデル、強度重み付け、明示的な欠損トークン許容率を指定して Spec2Vec を設定します。文書に記載された matchms のスコアリング例に従って参照スペクトルとクエリスペクトルを比較し、順位付けされた一致候補を取得します。想定される評価手順として、科学的なワークフローにスコアを採用する前に、代表的なクエリに対する結果を確認してください。

関連リソース

Matchms

オープンソース

Matchms は、タンデム質量スペクトルのインポート、クリーニング、比較に使う Python ツールキットです。設定可能な処理パイプライン、複数の類似度指標、疎なスコア保存機能を備えています。

オープンソースPython

分光法

MS2DeepScore

モデル

MS2DeepScore は、Siamese ニューラルネットワークを用いてタンデム質量スペクトルのペアから分子構造類似度を予測し、スペクトル埋め込み、推論、カスタムモデルの学習に使うツールを提供します。

オープンソースPython

分光法

校正済み1D NMR FID処理の説明とPythonヘルパーを含むK-Dense Skill。位相補正スペクトル、正のピーク候補、符号付き積分、再現可能な処理レポートを生成します。

オープンソースPython

分光法

関連ガイド

スキル

化学AI Skillsとは?研究エージェントの手順モジュールを理解する

化学AI Skillsを再利用可能な手順モジュールとして理解します。`SKILL.md`に何が含まれるか、ホストが指示をどう読み込むか、SkillsがMCPやエージェントとどう異なるか、そして指針を科学的検証と混同せずに選択、組み合わせ、評価する方法を説明します。

スキル

化学・材料科学のAI Skills:RDKit・Datamol・ASE・Phonopyほか

化学・材料分野の AI Skills 10 種を、科学的な役割、依存関係、入力、出力、ライセンスの適用範囲から比較し、分子解析、NMR 処理、フォノン、平衡計算、反応分子動力学の後処理に向けた範囲を限定した評価を計画します。