概要
MolGPT は、次トークン予測によって訓練する小規模なカスタム GPT を中心とした分子生成モデルのプロジェクトです。README では、MOSES および Guacamol データセットを使った訓練と、訓練後のモデルによる無条件および条件付きの分子生成について説明しています。引用されているプレプリントでは、この手法を transformer デコーダーモデルと位置づけています。研究ワークフローにおいて、このリポジトリは生成手法を調べるための入口となるものであり、エンドツーエンドの分子設計サービスとして文書化されているわけではありません。
文書に記載された訓練入力は、コードファイルと同じディレクトリに置く必要がある、前処理済みの CSV 形式データセットファイルです。README には、これらの前処理済みデータセット、それぞれの上流にある MOSES および Guacamol のリポジトリ、ならびに別途用意された訓練済み重みのコレクションへのリンクがあります。また、データセットごとの訓練スクリプトと、2 つの生成スクリプトが掲載されています。分子生成が出力タスクとして示されていますが、提示された抜粋では、生成物の表現形式、出力ファイル形式、条件入力の与え方は明記されていません。
説明されている研究には、解釈可能性も含まれます。顕著性マップは Ecco ライブラリを使って取得します。README には、MolGPT を両方のデータセットで先行手法と比較したとありますが、数値結果や評価プロトコルは示されていません。したがって、入手可能な根拠から確認できるのは訓練、生成、顕著性分析のワークフローであり、性能、化学的妥当性、生成候補の実用性が確立されているわけではありません。提示された抜粋には、インストール要件、ハードウェア要件、詳細なパラメータ設定も記載されていません。
主な機能
- MOSES および Guacamol データセットで、次トークン予測の目的関数を用いて訓練する小規模なカスタム GPT。
- README の記述によれば、無条件および条件付きの分子生成に対応。
- 個別の訓練エントリーポイント `train_moses.sh` と `train_guacamol.sh` を提供。
- 生成エントリーポイント `generate_guacamol_prop.sh` と `generate_moses_prop_scaf.sh` を掲載。
- 前処理済み CSV データセットと、別途用意された訓練済みモデル重みのコレクションにリンク。
- モデルの解釈可能性分析のため、Ecco に基づく顕著性マップについて説明。
用途
- 評価案:リンク先のデータセットと訓練済み重みを使用して、無条件および条件付きの分子生成を調査する。
- 評価案:MOSES および Guacamol のデータセット別訓練ワークフローを調べ、独自に定めた評価プロトコルで生成候補を評価する。
- 評価案:Ecco に基づく顕著性分析を試し、分子生成中のモデルの挙動を調べる。
使い方
- 公式 READMEを読み、訓練と生成の各エントリーポイントを確認します。提示された説明には、依存関係、ハードウェア要件、設定の詳細は記載されていません。
- リンク先のダウンロードフォルダーから前処理済み CSV データセットを入手します。データセットの背景については、上流の Guacamol および MOSES リポジトリを参照してください。
- 訓練する場合は、説明に従い、選択したデータセット CSV をコードファイルと同じディレクトリに置きます。対応するワークフローを選ぶ前に、リポジトリ内の
train_moses.shまたはtrain_guacamol.shを確認してください。 - 重みを使った評価を行う場合は、訓練済み重みのコレクションを参照してください。生成スクリプトを確認して、想定される入力と重みの読み込み設定を特定してください。これらの詳細は抜粋に記載されていません。
- 該当する、文書に記載された生成エントリーポイントを選び、その出力を独立して確認する計画を立てます。解釈可能性を調べる場合は、リポジトリ内の Ecco 関連の実装を確認してください。README は顕著性マップに言及していますが、手順は示していません。