scATAC-seq の差次的アクセシビリティ ─ 開き方が違う領域を見つける

scATAC-seq
📚 この記事について
下流解析の中心です。細胞型や条件のあいだで、開き方(アクセシビリティ)が有意に違うピークを統計的に見つけます。
🔙 前の記事scATAC-seq 下流解析の全体像
🔜 次の記事co-accessibility でピークを繋ぐ
📌 前提ピーク行列細胞型アノテーションが済んでいること

scATAC-seq(single-cell ATAC-seq/核を使う場合は snATAC-seq)の差次的アクセシビリティでは、2つの群で開き方が違うピークを見つけます。ここでは考え方・コード・結果の読み方を押さえます。

1. 差次的アクセシビリティとは


差次的アクセシビリティは、scRNA-seq の差次的発現(DEG)の ATAC 版です。2つの群——細胞型Aと細胞型B、あるいは健常と疾患など——で、開き方(アクセシビリティ)が統計的に有意に違うピークを見つけます。

図1:差次的アクセシビリティの概念(2群で開き方が違うピーク)
図1:差次的アクセシビリティの概念(2群で開き方が違うピーク)

見つかった領域は、その細胞型や状態を特徴づける制御領域の候補です。次にモチーフ濃縮や近傍遺伝子と結びつけて、「どの TF が・どの遺伝子を」動かしているかの解釈につなげます。

2. 2つのやり方


SnapATAC2 には、手早い方法と厳密な方法があります。まず全体を掴むなら前者、統計的に主張するなら後者です。

marker_regions(手早い) diff_test(厳密)
原理 z-scoreで各群に特異的な領域 回帰ベースで2群を統計検定
細胞ごとのばらつき 使わない 使う
出力 マーカー領域のリスト log2FC と 調整p値
使いどころ 全体像・モチーフ濃縮の入力 有意差を主張したいとき

3. コード:diff_test


2群を指定して検定し、調整p値(多重検定を補正した p 値)と log2 fold change(開き方の変化量)で絞ります(SnapATAC2:Zhang et al., Nature Methods, 2024)。

python
import snapatac2 as snap
# 前提:peak_mat(細胞×ピーク)、obs['cell_type'] あり

# 2群を選ぶ(例:B細胞 vs それ以外=one-vs-rest)
group1 = peak_mat.obs["cell_type"] == "B細胞"
group2 = ~group1

# 回帰ベースの差次検定
diff = snap.tl.diff_test(
    peak_mat,
    cell_group1=group1,
    cell_group2=group2,
)
df = diff.to_pandas()

# 有意な差次ピークを絞る(調整p値 < 0.05, |log2FC| > 0.25)
sig = df[(df["adjusted p-value"] < 0.05) &
         (df["log2(fold_change)"].abs() > 0.25)]
💡 用語:調整p値と log2 fold change
調整p値:何万ものピークを同時に検定すると偶然の当たりが増えるため、それを補正した p 値(FDR)。log2 fold change:2群の開き方の比を対数にしたもの。プラスならAで開き、マイナスならBで開く。

4. 結果を読む:火山プロット


差次検定の定番の可視化が火山プロットです。横軸に log2FC(変化の向きと大きさ)、縦軸に -log10(調整p値)(有意性)を取ります。

図2:差次ピークの火山プロット(右上=Aで開く/左上=Bで開く)
図2:差次ピークの火山プロット(右上=Aで開く/左上=Bで開く)

右上はAで有意に開く領域、左上はBで有意に開く領域です。中央付近(変化が小さい・有意でない)は差次ではありません。

5. 注意点


  • 生のp値ではなく調整p値で判断:多重検定の補正は必須です。
  • 群の取り方で意味が変わる:「1細胞型 vs 残り(one-vs-rest)」か「2細胞型どうし(pairwise)」かで、見つかる領域が変わります。目的に合わせて選びます。
  • 候補を絞ると安定features でどちらかの群に開くピークに限定すると、高速で結果も安定します。
  • 差次ピークはゴールでなく入口:モチーフ濃縮・近傍遺伝子・co-accessibilityにつないで初めて生物学的な意味になります。

まとめ


  • 差次的アクセシビリティ=2群で開き方が有意に違うピーク(DEGのATAC版)。
  • marker_regions(手早い)diff_test(厳密)。調整p値と log2FC で絞る。
  • 火山プロットで読み、モチーフや遺伝子につないで解釈する。

関連記事


参考文献


  • Zhang, K., Zemke, N. R., Armand, E. J., & Ren, B. (2024). A fast, scalable and versatile tool for analysis of single-cell omics data. Nature Methods, 21(2), 217–227. doi:10.1038/s41592-023-02139-9
  • Cusanovich, D. A., Daza, R., Adey, A., et al. (2015). Multiplex single-cell profiling of chromatin accessibility by combinatorial cellular indexing. Science, 348(6237), 910–914. doi:10.1126/science.aab1601

コメント

タイトルとURLをコピーしました