0. 개요
평균이 $\mu$이고 분산이 $\sigma^2$인 분포에서 생성한 임의표본(Random Sample) $X_1, X_2, \cdots, X_n$의 표분평균 $\overline{X} = \sum_{i=1}^{n} \frac{X_i}{n}$은 평균과 분산은 아래와 같습니다.
$$E[\overline{X}] = \mu, \quad Var[\overline{X}] = \frac{\sigma^2}{n}$$
위 식에 따라 표본의 수 $n$이 무한정 커진다면 표본평균의 분산이 0에 가까워지게 될 것입니다. 분산이 작다는 것은 변화하는 정도가 작다고 볼 수 있으므로 표본의 수가 클수록 모평균 $\mu$에 가까워 진다는 것을 의미하겠죠. 저희는 기존 분포의 평균과 분산을 알고있다면 표본평균의 평균과 분산을 알 수 있지만 표본평균이 어떤 분포를 따르는지는 알 수 없었습니다. 하지만 유일하게 모집단의 분포가 정규분포인 경우에는 표본평균의 분포가 정규분포를 따르는 $\overline{X} \sim N(\mu, \frac{\sigma^2}{n})$이라는 것을 알 수 있었죠.(참고 : https://moogie.tistory.com/118)
만약 분포가 정규분포가 아니라면 어떻게 표본평균의 분포를 알 수 있을까요? 분포가 간단하고 표본의 수가 작다면 과거 포스팅에서 정리한 자코비안을 활용한 변환을 적용해서 직접 정확한 분포를 구할 수 있을 것 입니다. (참고 : https://moogie.tistory.com/112 )
하지만, 분포가 복잡하거나 표본의 수가 증가한다면 다변량 변수의 변환이 복잡해져서 구하기 쉽지 않을 수 있습니다. 따라서 정확하지는 않더라도 근사적으로 특정 분포를 따른다는 것을 만족한다면 유용하지 않을까요? 오늘은 이러한 질문에 대한 대답이 되어줄 수 있는 중심극한정리(Central Limit Theorem)에 대해 알아보죠.
1. 중심극한정리(Central Limit Theorem, CLT)
만약 $\overline{X}$가 유한한 평균 $\mu$와 유한한 분산 $\sigma^2$을 가지는 분포로부터 생성된 임의표본 $X_1, X_2, \cdots, X_n$의 표본평균이고, 표본의 수 $n$이 무한대로 발산한다면 표준화된 변수 $\frac{\overline{X}-\mu}{\sigma / \sqrt{n}}$은 정규분포 $N(0, 1)$을 따른다.
$$W = \frac{\overline{X}-\mu}{\sigma / \sqrt{n}} = \frac{\sum_{i=1}^{n}X_i-n\mu}{\sqrt{n}\sigma} \sim N(0, 1)$$
다만 표본의 수($n$)가 무한정 커져야지 성립하는 것은 실생활에서 비현실적이므로 어느정도 큰 경우 근사적으로 따른다고 이해하면 좋을 듯 합니다. $n>30$인 경우 표본의 수가 크다고 할 수 있으며 기존 분포가 대칭적이거나 Unimodal(봉오리가 1개)인 분포인 경우 표본의 수가 4개~5개여도 괜찮다고 합니다.

2. 표본평균과 확률변수 합의 분포
따라서 두 확률변수의 함수(통계량)이 따르는 분포는 CLT에 따라 아래와 같이 근사적으로 정규분포를 따르는 것을 알 수 있습니다.
- $\overline{X} \sim N(\mu, \frac{\sigma^2}{n})$
- $\sum_{i=1}^{n}X_i \sim N(n\mu, n\sigma^2)$
3. 표준화 통계량의 분포
또한, 분포 $X$의 pdf와 cdf를 각각 $f_X(x)$, $F_X(x)$라 하면 Change-of-Variable Technique에 따라 $W=\frac{X-\mu}{\sigma}$의 pdf와 cdf는 아래와 같습니다.
- $F_W(w) = Pr[W<w] = Pr[\frac{X-\mu}{\sigma}<w] = Pr[X<\sigma w+\mu] = F_X(\sigma w + \mu)$
- $f_W(w) = \frac{d}{dw}F_W(w) = \sigma f_X(\sigma w + \mu)$

4. 증명
두 확률변수의 MGF가 동일한 경우 두 확률변수는 동일하다는 법칙에 따라 아래와 같이 증명이 가능합니다.

5. 실습
아래와 같이 균일분포 U(-6, 6)을 따르는 분포에서 30개의 Random Sample을 뽑은다음 표본평균 1,000,000개를 만들어줍니다.
$X_1, X_2, \cdots, X_n$은 균일분포 U(-6 ,6)을 따르기 때문에, $E[X] = 0$, $Var[X] = 12$를 만족합니다.
따라서 표본의 수가 30인 임의표본의 평균($\overline{X}$)는 근사적으로 정규분포 $N(0, \frac{12}{30})$을 만족할 것으로 기대되며 실제 아래 그래프를 확인해보면 표본평균의 분포가 정규분포랑 거의 비슷하다는 것을 알 수 있죠.
# Ui ~ U(-6, 6) --> E(Ui) = 0, Var[Ui] = 12
replicate(n=1e6, list(runif(n=30, min=-6, max=6))) %>%
map_dbl(mean) %>% hist(probability = T, breaks = 50)
# mean of random sample ~ N(0, 12/30)
x = seq(-3, 3, 0.01)
y = dnorm(x=x, mean = 0, sd = sqrt(12/30))
lines(x,y,col="red")
'Statistics > Mathmetical Statistics' 카테고리의 다른 글
| [확률과 통계적 추론] 5-8. Chebyshev's Inequality (체비쇼프 부등식) (0) | 2024.01.21 |
|---|---|
| [확률과 통계적 추론] 5-7. 연속성 수정 (Continuity Correction) (0) | 2024.01.20 |
| [확률과 통계적 추론] 10. 분포 정리 (0) | 2024.01.16 |
| [확률과 통계적 추론] 5-5.3 T 분포 (T Distribution) (0) | 2024.01.15 |
| [확률과 통계적 추론] 5-5.2 표본평균과 표본분산 관계 with Normal distribution (1) | 2024.01.15 |