SCENIC+ でエンハンサー駆動 GRN ─ TF・エンハンサー・遺伝子をつなぐ

Multiomics
📚 この記事について
GRN 推論スポークの本命です。マルチオミクスから、TF → エンハンサー → 遺伝子の「エンハンサー駆動 GRN(eGRN)」を SCENIC+ で組み立てます。専門用語はその都度説明します。
🔙 前の記事WNN(Seurat・R)の位置づけ(前の記事)
🔜 次の記事:「CellOracle で in silico 摂動
📌 前提:統合済み or ペアの multiome(RNA + ATAC)。SCENIC+ とデータベース(モチーフ・cisTarget)、計算資源。

シングルセル・マルチオミクス(single-cell multiomics/scRNA-seq と scATAC-seq の統合解析)は、統合の先で遺伝子制御ネットワーク(GRN)へ進みます。この記事では、SCENIC+ でエンハンサー駆動の GRN(eGRN)を組み立てます。

1. eGRN・eRegulon とは(TF → エンハンサー → 遺伝子)


統合の次の果実が 遺伝子制御ネットワーク(GRN)推論です。SCENIC+ は、マルチオミクスからエンハンサー駆動の GRN(eGRN)を組み立てる本命ツールです(Bravo González-Blas et al., Nat. Methods, 2023)。出力の単位は eRegulon ─ 1つの TF と、それが結合するエンハンサー、そしてその先の標的遺伝子のまとまりです。

図:eRegulon の構造。1つの TF(発現=RNA)が、結合するエンハンサー(開閉=ATAC)を介して標的遺伝子(発現=RNA)を制御する。このまとまりが eRegulon で、その集合が eGRN。
図:eRegulon の構造。1つの TF(発現=RNA)が、結合するエンハンサー(開閉=ATAC)を介して標的遺伝子(発現=RNA)を制御する。このまとまりが eRegulon で、その集合が eGRN。
💡 なぜエンハンサーが要るのか
ハブで述べたとおり、GRN の3要素のうちエンハンサーの開閉は ATAC でしか測れません。RNA 単独の GRN(SCENIC;Aibar et al., 2017)が TF↔遺伝子の共発現で推定するのに対し、SCENIC+ は「どのエンハンサーを介するか」まで踏み込みます。これがマルチオミクスの GRN の本質的な違いです。

2. SCENIC+ の3ステップ


SCENIC+ は3ステップの workflow です。ATAC から候補エンハンサーを見つけ、そこにどの TF が結合するか(モチーフ濃縮)を調べ、最後に領域アクセシビリティ・TF/遺伝子発現・結合情報を統合して eRegulon を作ります。

図:SCENIC+ の3ステップ。① pycisTopic で候補エンハンサー、② pycisTarget でモチーフ濃縮(cistrome)、③ SCENIC+ で領域・TF・遺伝子を統合して eRegulon を推論する。
図:SCENIC+ の3ステップ。① pycisTopic で候補エンハンサー、② pycisTarget でモチーフ濃縮(cistrome)、③ SCENIC+ で領域・TF・遺伝子を統合して eRegulon を推論する。
💡 3ステップの役割
① pycisTopic:ATAC のピークをトピックモデル(LDA)でまとめ、候補エンハンサー(トピック・DAR)を抽出。
② pycisTarget:候補領域でモチーフ濃縮を行い、どの TF がどの領域に結合するか(cistrome)を決める(大規模モチーフコレクションを使用;Weirauch et al., 2014)。
③ SCENIC+:領域アクセシビリティ・TF/遺伝子発現・cistrome を統合し、TF → 領域 → 遺伝子の eRegulon を推論する。

3. パイプラインを実行する


実行は、公式が用意する Snakemake パイプラインで回すのが標準です。前処理済みの ATAC(pycisTopic)と RNA、そしてモチーフ・cisTarget データベースを config に記述し、ワークフローを実行します。

bash
# SCENIC+ は Snakemake パイプラインで実行するのが公式推奨。
# 前処理済み ATAC(pycisTopic)・RNA と、モチーフ / cisTarget DB を
# config.yaml に記述してから、用意されたワークフローを回す:
snakemake --cores 20 --configfile config.yaml
⚠️ 注意点:データベースと計算資源
SCENIC+ は種ごとのモチーフ・cisTarget データベース(ヒト・マウス・ハエは配布あり)が必須です。トピックモデリングとモチーフ濃縮は計算量が大きく、大メモリ・複数コア(可能なら GPU)が要ります。各ステップには Python API もありますが、手順とキー名はバージョンで変わるため、必ず公式ドキュメントの当該バージョンに従ってください。

4. 出力を読む(eRegulon 活性)


パイプラインの出力には、eRegulon の一覧(TF → 領域 → 遺伝子)と、細胞ごとの eRegulon 活性(AUC)が含まれます。活性を細胞型ごとに見ると、どの TF がどの細胞型を駆動しているかが読めます。

python
import mudata as mu

# パイプラインの出力(eRegulon を含む MuData)を読み込む
scplus = mu.read("scplus_pipeline/scplusmdata.h5mu")

# eRegulon(TF → 領域 → 遺伝子)の一覧
scplus.uns["direct_e_regulon_metadata"].head()

# 細胞ごとの eRegulon 活性(AUC)は modality の obsm に入る
scplus.mod["scRNA_counts"].obsm.keys()
図:eRegulon 活性のヒートマップ(細胞型 × eRegulon)。濃いほど活性が高い。細胞型ごとに活性化する TF(eRegulon)が読み取れる。
図:eRegulon 活性のヒートマップ(細胞型 × eRegulon)。濃いほど活性が高い。細胞型ごとに活性化する TF(eRegulon)が読み取れる。
💡 eRegulon 活性の読み方
eRegulon 活性(AUC)は「その細胞でその eRegulon の標的がどれだけ協調して発現・アクセス可能か」を表します。細胞型 × eRegulon のヒートマップにすると細胞型特異的な TFが浮かびます。ここから、次のブロックのin silico 摂動(TF を操作したら細胞状態がどう動くか)へ進めます。

5. SCENIC(RNA 単独)との違い・使い分け


SCENIC+ は SCENIC(RNA 単独)の後継・拡張です。使い分けの目安を整理します。

💡 SCENIC と SCENIC+ の違い
SCENIC(Aibar et al., 2017)は RNA 単独で、TF↔遺伝子の共発現+プロモーターのモチーフから regulon を作ります。SCENIC+ は ATAC を加え、エンハンサー(遠位の制御領域)を明示的に介する eRegulonを作ります。RNA しかなければ SCENIC、マルチオミクスがあれば SCENIC+ が、より因果に近い制御を捉えます。

eGRN が組み上がれば、それを使って問いに答える下流へ進めます。次は、この GRN を使った in silico 摂動(CellOracle)です。

まとめ


  • SCENIC+ は、マルチオミクスからエンハンサー駆動 GRN(eGRN)を作る本命。単位は eRegulon(TF→エンハンサー→遺伝子)。
  • 3ステップ:pycisTopic(候補エンハンサー)→ pycisTarget(モチーフ濃縮=cistrome)→ SCENIC+(統合して eRegulon)。
  • エンハンサー層は ATAC でしか測れないため、RNA 単独の SCENIC より因果に近い制御を捉える。
  • 実行は Snakemake が標準。モチーフ・cisTarget DB と大きな計算資源が必要。API/キーはバージョン依存。
  • 出力は eRegulon 一覧と細胞ごとの活性(AUC)。細胞型特異的な TF が読める。次は in silico 摂動へ。

関連記事


参考文献


  • Bravo González-Blas, C., De Winter, S., Hulselmans, G., et al. (2023). SCENIC+: single-cell multiomic inference of enhancers and gene regulatory networks. Nature Methods, 20(9), 1355–1367. doi:10.1038/s41592-023-01938-4
  • Aibar, S., González-Blas, C. B., Moerman, T., et al. (2017). SCENIC: single-cell regulatory network inference and clustering. Nature Methods, 14(11), 1083–1086. doi:10.1038/nmeth.4463
  • Weirauch, M. T., Yang, A., Albu, M., et al. (2014). Determination and inference of eukaryotic transcription factor sequence specificity. Cell, 158(6), 1431–1443. doi:10.1016/j.cell.2014.08.009
  • Cusanovich, D. A., Daza, R., Adey, A., et al. (2015). Multiplex single-cell profiling of chromatin accessibility by combinatorial cellular indexing. Science, 348(6237), 910–914. doi:10.1126/science.aab1601
  • Ashuach, T., Gabitto, M. I., Koodli, R. V., et al. (2023). MultiVI: deep generative model for the integration of multimodal data. Nature Methods, 20(8), 1222–1231. doi:10.1038/s41592-023-01909-9

コメント

タイトルとURLをコピーしました