[확률과 통계적 추론] 5-6. 중심극한정리(Central Limit Theorem)

2024. 1. 19. 15:44·Statistics/Mathmetical Statistics

 

 

0. 개요

평균이 $\mu$이고 분산이 $\sigma^2$인 분포에서 생성한 임의표본(Random Sample) $X_1, X_2, \cdots, X_n$의 표분평균 $\overline{X} = \sum_{i=1}^{n} \frac{X_i}{n}$은 평균과 분산은 아래와 같습니다.
$$E[\overline{X}] = \mu, \quad Var[\overline{X}] = \frac{\sigma^2}{n}$$
 
위 식에 따라 표본의 수 $n$이 무한정 커진다면 표본평균의 분산이 0에 가까워지게 될 것입니다. 분산이 작다는 것은 변화하는 정도가 작다고 볼 수 있으므로 표본의 수가 클수록 모평균 $\mu$에 가까워 진다는 것을 의미하겠죠. 저희는 기존 분포의 평균과 분산을 알고있다면 표본평균의 평균과 분산을 알 수 있지만 표본평균이 어떤 분포를 따르는지는 알 수 없었습니다. 하지만 유일하게 모집단의 분포가 정규분포인 경우에는 표본평균의 분포가 정규분포를 따르는 $\overline{X} \sim N(\mu, \frac{\sigma^2}{n})$이라는 것을 알 수 있었죠.(참고 : https://moogie.tistory.com/118)
 
만약 분포가 정규분포가 아니라면 어떻게 표본평균의 분포를 알 수 있을까요? 분포가 간단하고 표본의 수가 작다면 과거 포스팅에서 정리한 자코비안을 활용한 변환을 적용해서 직접 정확한 분포를 구할 수 있을 것 입니다. (참고 : https://moogie.tistory.com/112 )
하지만, 분포가 복잡하거나 표본의 수가 증가한다면 다변량 변수의 변환이 복잡해져서 구하기 쉽지 않을 수 있습니다. 따라서 정확하지는 않더라도 근사적으로 특정 분포를 따른다는 것을 만족한다면 유용하지 않을까요? 오늘은 이러한 질문에 대한 대답이 되어줄 수 있는 중심극한정리(Central Limit Theorem)에 대해 알아보죠.
 
 

1. 중심극한정리(Central Limit Theorem, CLT) 

 
만약 $\overline{X}$가 유한한 평균 $\mu$와 유한한 분산 $\sigma^2$을 가지는 분포로부터 생성된 임의표본 $X_1, X_2, \cdots, X_n$의 표본평균이고, 표본의 수 $n$이 무한대로 발산한다면 표준화된 변수 $\frac{\overline{X}-\mu}{\sigma / \sqrt{n}}$은 정규분포 $N(0, 1)$을 따른다.
 
$$W = \frac{\overline{X}-\mu}{\sigma / \sqrt{n}} = \frac{\sum_{i=1}^{n}X_i-n\mu}{\sqrt{n}\sigma} \sim N(0, 1)$$
 
다만 표본의 수($n$)가 무한정 커져야지 성립하는 것은 실생활에서 비현실적이므로 어느정도 큰 경우 근사적으로 따른다고 이해하면 좋을 듯 합니다. $n>30$인 경우 표본의 수가 크다고 할 수 있으며 기존 분포가 대칭적이거나 Unimodal(봉오리가 1개)인 분포인 경우 표본의 수가 4개~5개여도 괜찮다고 합니다. 
 

 

2. 표본평균과 확률변수 합의 분포

따라서 두 확률변수의 함수(통계량)이 따르는 분포는 CLT에 따라 아래와 같이 근사적으로 정규분포를 따르는 것을 알 수 있습니다.

  • $\overline{X} \sim N(\mu, \frac{\sigma^2}{n})$
  • $\sum_{i=1}^{n}X_i \sim N(n\mu, n\sigma^2)$

 
 

3. 표준화 통계량의 분포

또한, 분포 $X$의 pdf와 cdf를 각각 $f_X(x)$, $F_X(x)$라 하면 Change-of-Variable Technique에 따라 $W=\frac{X-\mu}{\sigma}$의 pdf와 cdf는 아래와 같습니다. 

  • $F_W(w) = Pr[W<w] = Pr[\frac{X-\mu}{\sigma}<w] = Pr[X<\sigma w+\mu] = F_X(\sigma w + \mu)$
  • $f_W(w) = \frac{d}{dw}F_W(w) = \sigma f_X(\sigma w + \mu)$

 

 
 

4. 증명

두 확률변수의 MGF가 동일한 경우 두 확률변수는 동일하다는 법칙에 따라 아래와 같이 증명이 가능합니다.
 

 
 

5. 실습

아래와 같이 균일분포 U(-6, 6)을 따르는 분포에서 30개의 Random Sample을 뽑은다음 표본평균 1,000,000개를 만들어줍니다.
$X_1, X_2, \cdots, X_n$은 균일분포 U(-6 ,6)을 따르기 때문에, $E[X] = 0$, $Var[X] = 12$를 만족합니다.
따라서 표본의 수가 30인 임의표본의 평균($\overline{X}$)는 근사적으로 정규분포 $N(0, \frac{12}{30})$을 만족할 것으로 기대되며 실제 아래 그래프를 확인해보면 표본평균의 분포가 정규분포랑 거의 비슷하다는 것을 알 수 있죠.

# Ui ~ U(-6, 6) --> E(Ui) = 0, Var[Ui] = 12
replicate(n=1e6, list(runif(n=30, min=-6, max=6))) %>% 
  map_dbl(mean) %>% hist(probability = T, breaks = 50)

# mean of random sample ~ N(0, 12/30)
x = seq(-3, 3, 0.01)
y = dnorm(x=x, mean = 0, sd = sqrt(12/30))
lines(x,y,col="red")

'Statistics > Mathmetical Statistics' 카테고리의 다른 글

[확률과 통계적 추론] 5-8. Chebyshev's Inequality (체비쇼프 부등식)  (0) 2024.01.21
[확률과 통계적 추론] 5-7. 연속성 수정 (Continuity Correction)  (0) 2024.01.20
[확률과 통계적 추론] 10. 분포 정리  (0) 2024.01.16
[확률과 통계적 추론] 5-5.3 T 분포 (T Distribution)  (0) 2024.01.15
[확률과 통계적 추론] 5-5.2 표본평균과 표본분산 관계 with Normal distribution  (1) 2024.01.15
'Statistics/Mathmetical Statistics' 카테고리의 다른 글
  • [확률과 통계적 추론] 5-8. Chebyshev's Inequality (체비쇼프 부등식)
  • [확률과 통계적 추론] 5-7. 연속성 수정 (Continuity Correction)
  • [확률과 통계적 추론] 10. 분포 정리
  • [확률과 통계적 추론] 5-5.3 T 분포 (T Distribution)
임파카
임파카
[ML & Statistics] 모바일 버전에서 수식 오류가 있어 PC 환경에서 접속하는 것을 권장합니다.
  • 임파카
    무기의 스탯(Stat)
    임파카
  • 전체
    오늘
    어제
    • Study (151)
      • Data Science (45)
        • Modeling (18)
        • Manipulation (21)
        • Visualization (5)
      • Statistics (60)
        • Mathmetical Statistics (54)
        • Categorical DA (1)
      • Web Programming (17)
      • Marketing (0)
      • AI (26)
        • Machine Learning (16)
        • Deep Learning (10)
      • 활동 및 프로젝트 (3)
  • 인기 글

  • hELLO· Designed By정상우.v4.10.5
임파카
[확률과 통계적 추론] 5-6. 중심극한정리(Central Limit Theorem)
상단으로

티스토리툴바