scATAC-seq 前処理の全体像 ─ QC からクラスタリングまで

scATAC-seq
📚 この記事について
scATAC-seq 前処理ブロックの入口です。読み込みからクラスタリングまでの流れを俯瞰し、各ステップの詳細記事へ橋渡しします。
🔙 前の記事scATAC-seq 解析ツールの選び方
🔜 次の記事scATAC-seq のデータ読み込みとデータ構造
📌 前提scATAC-seq 解析の全体像を読んでいると流れが掴みやすいです

scATAC-seq(single-cell ATAC-seq/核を使う場合は snATAC-seq)の前処理は、生データを「クラスタリングできるきれいな低次元表現」に変える工程です。この記事では、その全体像と各ステップへの入口を示します。

1. 前処理のゴール


前処理の目的は一つ、生データを「クラスタリングできるきれいな低次元表現」に変えることです。入口はフラグメント(Tn5酵素がゲノムを切って生じるDNA断片)、出口は細胞のまとまり(クラスタ)。この間に、品質の悪い細胞を除き、特徴量(ピーク)を定義し、次元を圧縮します。

2. 前処理パイプライン


基本の流れは5ステップです。ダブレット検出とサンプル統合は、データに応じて挟む任意ステップです。

図:scATAC-seq 前処理パイプライン(基本5ステップ+任意ステップ)
図:scATAC-seq 前処理パイプライン(基本5ステップ+任意ステップ)

3. scRNA-seq 前処理との違い


scRNA-seq を経験していると、ほとんどの発想は流用できます。ただし4点だけ本質的に違うので、そこだけ意識すれば十分です。

観点 scRNA-seq scATAC-seq
特徴量 遺伝子 ピーク(データから作る)
行列の性質 カウント(連続的) ほぼ二値・超スパース
正規化 対数正規化 TF-IDF
次元削減 PCA SVD(=LSI)
主なQC指標 遺伝子数・ミト率 TSS濃縮・FRiP・ヌクレオソームシグナル
💡 なぜ正規化・次元削減が違うのか
ATACの行列は値がほぼ 0/1/2(二倍体はゲノム座位のコピーが2本だけ)で、極端に疎です。カウントの大小を前提とする対数正規化+PCAが噛み合わないため、文書解析由来の TF-IDF+SVD(=LSI) を使います(scATACへの適用:Cusanovich et al., Science, 2015)。

4. 各ステップの入口


① 読み込みとデータ構造:フラグメントファイルとピーク行列を AnnData に読み込みます。RNAの細胞×遺伝子に対し、ここは細胞×ピークです。
scATAC-seq のデータ読み込みとデータ構造

② QC(品質管理):ATAC固有の指標で低品質な細胞を除きます。主に TSS濃縮(転写開始点まわりにシグナルが集まるほど良い)、FRiP(ピーク内に入るフラグメントの割合)、ヌクレオソームシグナル(フラグメント長分布の周期性)、フラグメント総数です。
scATAC-seq の QC

③ ダブレット検出:2細胞が1つに混ざったノイズを除きます。ATACでは1座位あたり最大2コピーという性質を利用する AMULET などが使われます(Thibodeau et al., Genome Biology, 2021)。
scATAC-seq のダブレット検出

④ ピークコール:フラグメントが密集した領域をピークとして定義します。MACS3(MACS2の現行版)が標準で、SnapATAC2 内蔵の手法も使えます(MACS:Zhang et al., Genome Biology, 2008)。
scATAC-seq のピークコール

⑤ 次元削減・クラスタリング:TF-IDF で重み付けし、SVD(LSI)系で圧縮してからクラスタリングします。
scATAC-seq の次元削減とクラスタリング

⚠️ 次元削減で覚えておきたい点
LSIの第1成分は、細胞型ではなくシーケンス深度と強く相関しがちです。実装(SnapATAC2・Signac など)では慣例的に第1成分を除外します。これを忘れるとクラスタが深度で分かれてしまいます。

⑥ サンプル統合・バッチ補正:複数サンプルをまとめる際に、実験差(バッチ)を補正します。古典的な Harmony(Korsunsky et al., Nature Methods, 2019)と、深層学習の PeakVI(Ashuach et al., 2022)を対比して選びます。
scATAC-seq の統合・バッチ補正

まとめ


  • 前処理のゴールは「フラグメント → クラスタリング可能な低次元表現」。
  • RNAとの本質的な違いは特徴量・行列の性質・正規化・次元削減の4点。
  • 迷ったら SnapATAC2 で一貫させるのが最も楽。

関連記事


参考文献


  • Cusanovich, D. A., Daza, R., Adey, A., et al. (2015). Multiplex single-cell profiling of chromatin accessibility by combinatorial cellular indexing. Science, 348(6237), 910–914. doi:10.1126/science.aab1601
  • Thibodeau, A., Eroglu, A., McGinnis, C. S., et al. (2021). AMULET: a novel read count-based method for effective multiplet detection from single nucleus ATAC-seq data. Genome Biology, 22, 252. doi:10.1186/s13059-021-02469-x
  • Zhang, Y., Liu, T., Meyer, C. A., et al. (2008). Model-based Analysis of ChIP-Seq (MACS). Genome Biology, 9(9), R137. doi:10.1186/gb-2008-9-9-r137
  • Korsunsky, I., Millard, N., Fan, J., et al. (2019). Fast, sensitive and accurate integration of single-cell data with Harmony. Nature Methods, 16(12), 1289–1296. doi:10.1038/s41592-019-0619-0
  • Zhang, K., Zemke, N. R., Armand, E. J., & Ren, B. (2024). A fast, scalable and versatile tool for analysis of single-cell omics data. Nature Methods, 21(2), 217–227. doi:10.1038/s41592-023-02139-9

コメント

タイトルとURLをコピーしました