RNA-seq 데이터 분석: DESeq2를 이용한 차등 발현 분석 가이드

학습 목표

  • 통계 모델 설계 방법 이해
  • DESeq2 패키지를 활용한 차등 발현 분석 절차 습득

1. 차등 발현 분석 개요

차등 발현 분석의 핵심 과정은 원시 카운트 데이터를 음이항 분포 모델에 적합화하고 통계적 검정을 통해 유의미하게 발현이 다른 유전자를 식별하는 것입니다. 이 과정을 통해 우리는 다양한 표본 그룹 간의 평균 발현 수준에 통계적으로 유의미한 차이가 존재하는지 판별할 수 있습니다.

DESeq2는 2014년에 발표된 바이오컴퓨팅 패키지로, R 환경의 Bioconductor를 통해 지속적으로 업데이트되고 있습니다. 이 패키지는 분산 추정과 일반화 선형 모델에 기반을 두고 있으며, DSS와 edgeR에서 사용되는 방법론을 발전시켰습니다.

DESeq2를 이용한 차등 발현 분석은 아래 다이어그램의 파란색 부분과 같이 여러 단계로 구성됩니다. 간랑히 말해, DESeq2는 원시 카운트 데이터를 모델링하며, 정규화 인자(크기 인자)를 사용하여 서열 라이브러리 깊이 차이를 보정합니다. 그 다음, 유전자별 분산을 추정하고 이를 축소하여 더 정확한 분산 추정치를 생성합니다. 마지막으로 음이항 모델을 적합화하고 Wald 검정 또는 우도비 검정을 가설 검정에 활용합니다.

2. 설계 공식(Design Formula)

차등 발현 분석을 수행하기 전에, QC 단계에서의 탐색 분석이나 사전 지식을 통해 데이터 내의 변동 요인을 파악하는 것이 중요합니다. 주요 변동 요인을 파악했다면, 이를 분석 전에 제거하거나 설계 공식에 포함시켜 통계 모델에서 통제할 수 있습니다.

설계 공식은 통계 소프트웨어가 통제해야 할 알려진 변동 요인과 차등 발현 검정 시 테스트할 관심 인자를 지시합니다. 예를 들어, '성별'이 데이터 변동의 중요한 요인임을 알고 있다면 모델에 '성별'을 포함시켜야 합니다. 설계 공식은 데이터의 주요 변동 원인을 설명할 수 있는 모든 요인을 포함해야 하며, 마지막으로 입력된 요인이 관심 조건이어야 합니다.

예를 들어, 다음과 같은 메타데이터가 있다고 가정해 보겠습니다:

처리 그룹 간의 발현 차이를 검증하려고 하며, '성별'과 '나이'가 변동의 주요 원인임을 알고 있다면, 설계 공식은 다음과 같이 작성됩니다:

design = ~ 성별 + 나이 + 처리

물결표(~)는 항상 요인 앞에 위치하며 DESeq2에 다음 공식을 사용하여 카운트를 모델링하도록 지시합니다. **설계 공식에 포함된 요인은 메타데이터의 열 이름과 일치해야 합니다**.

2.1. 복잡한 경우 분석

DESeq2는 더 복잡한 상황 분석도 허용합니다. 상호작용 효과나 "차이 속의 차이"를 탐색하기 위해 설계 공식에서 지정할 수 있습니다. 예를 들어, '성별'이 치료 효과에 미치는 영향을 탐색하려면 다음과 같이 설계 공식에 지정할 수 있습니다:

design = ~ 성별 + 나이 + 처리 + 성별:처리

상호작용 항목 '성별:처리'가 공식의 마지막에 위치하므로, DESeq2 출력 결과는 해당 항목의 결과를 제공합니다.

3. MOV10 유전자 차등 발현 분석 구현

이제 DESeq2가 사용하는 모델을 지정하는 방법을 알았으므로, 원시 카운트 데이터에서 차등 발현 파이프라인을 실행할 수 있습니다.

원시 카운트 데이터에서 차등 발현 결과를 얻기 위해 다음 두 줄의 코드만 실행하면 됩니다!

먼저, "카운트 정규화" 과정에서와 같이 DESeqDataSet를 생성하고, 원시 카운트를 포함하는 txi 객체, 메타데이터 변수를 지정하며 설계 공식을 제공합니다:


# DESeq2Dataset 객체 생성
dds <- DESeqDataSetFromTximport(txi, colData = 메타데이터, design = ~ 표본유형)

그런 다음 차등 발현 분석을 실행하기 위해 DESeq() 함수를 사용합니다:


# 차등 발현 분석 실행
dds <- DESeq(dds)

함수의 결과를 동일한 변수 이름에 다시 할당함으로써 DESeqDataSet 객체를 채울 수 있습니다.

정규화부터 선형 모델링까지, 모든 과정이 위의 두 줄 코드로 이루어집니다! 이 함수는 수행하는 각 단계에 대해 다음 메시지를 출력합니다:


크기 인자 추정 중
분산 추정 중
유전자별 분산 추정
평균-분산 관계 계산
최종 분산 추정
모델 적합 및 검정 중

각 단계에서 발생하는 구체적인 내용은 다음 강의에서 다룰 것입니다. 하지만 이러한 단계를 수행하는 코드는 위의 두 줄에 포함되어 있습니다.

태그: RNA-seq DESeq2 차등 발현 분석 R 생정보학

7월 21일 00:07에 게시됨