本文へスキップ

Matchms

matchms developer team / Düsseldorf University of Applied Sciences & Netherlands eScience Center

Matchms は、タンデム質量スペクトルのインポート、クリーニング、比較に使う Python ツールキットです。設定可能な処理パイプライン、複数の類似度指標、疎なスコア保存機能を備えています。

掲載情報の更新 ·

概要

Matchms は、タンデム質量分析(MS/MS)データを処理し、参照スペクトルとクエリスペクトルを比較するための Python ライブラリです。独立した予測モデルではなく、スペクトル解析ワークフローの前処理とスコアリングの段階を提供します。ドキュメントに記載されている入力形式には、mzML、mzXML、msp、MGF、JSON、および metabolomics-USI 経由で取得したスペクトルが含まれます。出力には、処理済みスペクトル、ペアごとの類似度スコア、個々のクエリに対する順位付きマッチが含まれます。パイプラインの例では、クリーニング済みのクエリスペクトルと参照スペクトルを MGF ファイルに書き出す方法も示されています。

ワークフローでは、類似度の計算前に、メタデータの標準化、検証、強度の正規化、ピークのフィルタリングを組み合わせられます。Pipeline クラスは、YAML ワークフロー定義の作成、インポート、エクスポート、変更に対応します。また、カスタム処理が必要な場合は、インポート、フィルタリング、スコアリングの各関数を個別に使用できます。ドキュメントに記載されているスコアリング方法には、コサイン、修正コサイン、中性損失の比較に加え、分子フィンガープリントとメタデータに基づく指標があります。疎なスコア処理では、計算済みの非 null 値を保存します。また、段階的なスコアリングでは、最初の指標を使って後続の比較対象を絞り込めます。

Matchms はカスタム類似度指標にも対応しています。Spec2Vec と MS2DeepScore は Matchms のスコアリングインターフェースに準拠した別個のパッケージであり、Matchms 自体に組み込まれた予測モデルではありません。README では matchms 1.0 で予定されている変更が告知され、記載内容の多くが旧版 README のガイダンスとして示されています。そのため、利用者は選択したパッケージバージョンに照らしてドキュメントを確認してください。提供されたパッケージ設定では Python の対象バージョンが 3.10 から 3.14 に限定されています。より新しいバージョンでも動作する可能性があるという README の記述は、互換性を保証するものではありません。

主な機能

  • mzML、mzXML、msp、MGF、JSON からスペクトルをインポートできます。metabolomics-USI 経由での取得もドキュメントに記載されています。
  • メタデータのクリーニングと検証、強度の正規化、ピーク選択フィルターを提供します。前駆体 m/z 付近のピークの除去も含まれます。
  • `Pipeline` クラスと、インポート・エクスポート可能な YAML 設定を使って、再利用可能な処理・スコアリングワークフローを定義できます。
  • コサイン、修正コサイン、中性損失、分子フィンガープリント、メタデータに基づくスペクトル比較方法を提供します。
  • 計算済みの非 null スコアを疎に保存し、初期の事前選別指標を用いた段階的な比較に対応します。
  • `scores_by_query` を通じてクエリの順位付きマッチを取得でき、カスタムまたは別途インストールした類似度指標を受け入れます。

用途

  • 評価案:メタデータを標準化し、クリーニング済みの参照スペクトルを書き出す、再現可能な MS/MS ライブラリクリーニングワークフローを構築する。
  • 評価案:クエリスペクトルを参照ライブラリと比較し、コサインまたは修正コサインで順位付けされたマッチと、一致したピーク数を確認する。
  • 評価案:代表的なスペクトルを用いて、ピークフィルタリングと正規化がスペクトル類似度の結果に与える影響を評価する。
  • 評価案:共通の処理ワークフローで、組み込みのスコアリング方法と別途インストールした Spec2Vec または MS2DeepScore を比較する。

使い方

  1. パッケージバージョンを選ぶ前に、リポジトリのガイダンスとドキュメントを確認してください。matchms 1.0 で予定されている変更についての README の告知を考慮し、開発版の例が使用するインストール済みバージョンと一致するとは限らないことに注意してください。
  2. 依存関係の競合を減らすため、新しい環境でドキュメントに記載されたインストール手順に従ってください。選択したパッケージの Python 要件を確認してください。提供された設定では Python 3.10–3.14 が指定されています。
  3. 提供されている農薬の例から始め、独自のスペクトル形式についてはインポート APIを参照してください。
  4. フィルタリング APIを使って、メタデータとピークの処理手順を選択してください。Pipeline で YAML ワークフローを保存するか、個別の関数を組み合わせてカスタム処理を行ってください。
  5. 類似度 APIから指標を選択し、参照スペクトルとクエリスペクトルのスコアを計算して、順位付きマッチを確認してください。想定される評価手順として、規模を拡大する前に、代表的な入力でフィルタリング方法と許容誤差を比較してください。

関連リソース

MS2DeepScore

モデル

MS2DeepScore は、Siamese ニューラルネットワークを用いてタンデム質量スペクトルのペアから分子構造類似度を予測し、スペクトル埋め込み、推論、カスタムモデルの学習に使うツールを提供します。

オープンソースPython

分光法

校正済み1D NMR FID処理の説明とPythonヘルパーを含むK-Dense Skill。位相補正スペクトル、正のピーク候補、符号付き積分、再現可能な処理レポートを生成します。

オープンソースPython

分光法

Spec2Vec

モデル

Spec2Vec は、MS/MS スペクトルの類似度スコアリングを行う Python パッケージです。質量フラグメントと中性脱離から学習した Word2Vec 埋め込みを用いて、クエリスペクトルと参照スペクトルを比較します。

オープンソースPython

分光法

関連ガイド

スキル

化学AI Skillsとは?研究エージェントの手順モジュールを理解する

化学AI Skillsを再利用可能な手順モジュールとして理解します。`SKILL.md`に何が含まれるか、ホストが指示をどう読み込むか、SkillsがMCPやエージェントとどう異なるか、そして指針を科学的検証と混同せずに選択、組み合わせ、評価する方法を説明します。

スキル

化学・材料科学のAI Skills:RDKit・Datamol・ASE・Phonopyほか

化学・材料分野の AI Skills 10 種を、科学的な役割、依存関係、入力、出力、ライセンスの適用範囲から比較し、分子解析、NMR 処理、フォノン、平衡計算、反応分子動力学の後処理に向けた範囲を限定した評価を計画します。