scATAC-seq(single-cell ATAC-seq/核を使う場合は snATAC-seq)の前処理は、生データを「クラスタリングできるきれいな低次元表現」に変える工程です。この記事では、その全体像と各ステップへの入口を示します。
1. 前処理のゴール
前処理の目的は一つ、生データを「クラスタリングできるきれいな低次元表現」に変えることです。入口はフラグメント(Tn5酵素がゲノムを切って生じるDNA断片)、出口は細胞のまとまり(クラスタ)。この間に、品質の悪い細胞を除き、特徴量(ピーク)を定義し、次元を圧縮します。
2. 前処理パイプライン
基本の流れは5ステップです。ダブレット検出とサンプル統合は、データに応じて挟む任意ステップです。
3. scRNA-seq 前処理との違い
scRNA-seq を経験していると、ほとんどの発想は流用できます。ただし4点だけ本質的に違うので、そこだけ意識すれば十分です。
| 観点 | scRNA-seq | scATAC-seq |
|---|---|---|
| 特徴量 | 遺伝子 | ピーク(データから作る) |
| 行列の性質 | カウント(連続的) | ほぼ二値・超スパース |
| 正規化 | 対数正規化 | TF-IDF |
| 次元削減 | PCA | SVD(=LSI) |
| 主なQC指標 | 遺伝子数・ミト率 | TSS濃縮・FRiP・ヌクレオソームシグナル |
ATACの行列は値がほぼ 0/1/2(二倍体はゲノム座位のコピーが2本だけ)で、極端に疎です。カウントの大小を前提とする対数正規化+PCAが噛み合わないため、文書解析由来の TF-IDF+SVD(=LSI) を使います(scATACへの適用:Cusanovich et al., Science, 2015)。
4. 各ステップの入口
① 読み込みとデータ構造:フラグメントファイルとピーク行列を AnnData に読み込みます。RNAの細胞×遺伝子に対し、ここは細胞×ピークです。
→ scATAC-seq のデータ読み込みとデータ構造
② QC(品質管理):ATAC固有の指標で低品質な細胞を除きます。主に TSS濃縮(転写開始点まわりにシグナルが集まるほど良い)、FRiP(ピーク内に入るフラグメントの割合)、ヌクレオソームシグナル(フラグメント長分布の周期性)、フラグメント総数です。
→ scATAC-seq の QC
③ ダブレット検出:2細胞が1つに混ざったノイズを除きます。ATACでは1座位あたり最大2コピーという性質を利用する AMULET などが使われます(Thibodeau et al., Genome Biology, 2021)。
→ scATAC-seq のダブレット検出
④ ピークコール:フラグメントが密集した領域をピークとして定義します。MACS3(MACS2の現行版)が標準で、SnapATAC2 内蔵の手法も使えます(MACS:Zhang et al., Genome Biology, 2008)。
→ scATAC-seq のピークコール
⑤ 次元削減・クラスタリング:TF-IDF で重み付けし、SVD(LSI)系で圧縮してからクラスタリングします。
→ scATAC-seq の次元削減とクラスタリング
LSIの第1成分は、細胞型ではなくシーケンス深度と強く相関しがちです。実装(SnapATAC2・Signac など)では慣例的に第1成分を除外します。これを忘れるとクラスタが深度で分かれてしまいます。
⑥ サンプル統合・バッチ補正:複数サンプルをまとめる際に、実験差(バッチ)を補正します。古典的な Harmony(Korsunsky et al., Nature Methods, 2019)と、深層学習の PeakVI(Ashuach et al., 2022)を対比して選びます。
→ scATAC-seq の統合・バッチ補正
まとめ
- 前処理のゴールは「フラグメント → クラスタリング可能な低次元表現」。
- RNAとの本質的な違いは特徴量・行列の性質・正規化・次元削減の4点。
- 迷ったら SnapATAC2 で一貫させるのが最も楽。
関連記事
参考文献
- Cusanovich, D. A., Daza, R., Adey, A., et al. (2015). Multiplex single-cell profiling of chromatin accessibility by combinatorial cellular indexing. Science, 348(6237), 910–914. doi:10.1126/science.aab1601
- Thibodeau, A., Eroglu, A., McGinnis, C. S., et al. (2021). AMULET: a novel read count-based method for effective multiplet detection from single nucleus ATAC-seq data. Genome Biology, 22, 252. doi:10.1186/s13059-021-02469-x
- Zhang, Y., Liu, T., Meyer, C. A., et al. (2008). Model-based Analysis of ChIP-Seq (MACS). Genome Biology, 9(9), R137. doi:10.1186/gb-2008-9-9-r137
- Korsunsky, I., Millard, N., Fan, J., et al. (2019). Fast, sensitive and accurate integration of single-cell data with Harmony. Nature Methods, 16(12), 1289–1296. doi:10.1038/s41592-019-0619-0
- Zhang, K., Zemke, N. R., Armand, E. J., & Ren, B. (2024). A fast, scalable and versatile tool for analysis of single-cell omics data. Nature Methods, 21(2), 217–227. doi:10.1038/s41592-023-02139-9


コメント