본문으로 이동
메뉴 여닫기
환경 설정 메뉴 여닫기
개인 메뉴 여닫기
로그인하지 않음
지금 편집한다면 당신의 IP 주소가 공개될 수 있습니다.
Central Limit Theorem, CLT; 중심극한정리
모집단이 어떤 분포이든 표본 크기가 커지면 표본평균의 분포가 정규 분포에 가까워진다는 정리

평균이 μ이고 분산이 σ²인 모집단에서 크기 n인 표본을 뽑아 표본평균을 구하는 일을 반복하면, 표본평균들이 이루는 분포(표본 분포)는 n이 커질수록 평균 μ, 표준편차 σ/√n인 정규 분포에 가까워진다. 모집단 분포가 치우쳐 있거나 이산형이어도 성립하므로, 모집단 분포를 모르는 상태에서도 표본평균을 이용한 통계적 추정과 통계적 가설 검정을 할 수 있는 근거가 된다. 정규 분포가 통계학에서 널리 쓰이는 이론적 근거로도 꼽힌다.

확률변수 X1, X2, …, Xn이 서로 독립이고 같은 분포(iid)를 따르며, 평균이 μ, 분산이 유한한 σ²(0 < σ² < ∞)이라고 하자. 표본평균을 다음과 같이 둔다.

X¯n=1n∑i=1nXi

이때 표본평균을 표준화한 값의 분포는 n이 한없이 커지면 표준정규분포 N(0, 1)로 수렴한다(분포 수렴).

Zn=X¯n−μσ/n→N(0,1)(n→∞)

실무에서는 n이 충분히 클 때 다음과 같이 근사해서 쓴다.

X¯n≈N(μ,σ2n),∑i=1nXi≈N(nμ,nσ2)

항목 내용
전제 조건 관측치가 서로 독립이고 같은 분포를 따르며, 모집단 분산이 유한하다.
모집단 분포 제한이 없다. 균등, 지수, 이항 등 어떤 분포여도 된다.
표본평균의 평균 모평균 μ와 같다.
표본평균의 분산 σ²/n. 표본평균의 표준편차 σ/√n을 표준오차라 한다.
결론 n이 커지면 표본평균의 분포가 정규 분포에 가까워진다.
  • 모집단 자체가 정규 분포이면 n과 관계없이 표본평균은 정확히 정규 분포를 따른다. 중심 극한 정리는 모집단이 정규 분포가 아닐 때 의미가 크다.
  • 분산이 무한한 분포(예: 코시 분포)에는 성립하지 않는다.
  • 중심 극한 정리는 표본평균의 분포에 대한 정리이다. 표본 크기를 늘린다고 개별 관측치나 모집단의 분포가 정규 분포로 바뀌는 것은 아니다.
  • 교재와 실무에서는 흔히 "표본 크기가 30 이상이면 표본평균이 정규 분포를 따른다고 보아도 된다"고 한다. 이는 정리에서 나오는 값이 아니라 관례적인 기준이다.
  • 필요한 n은 모집단 분포의 모양에 따라 다르다. 대칭에 가까운 분포는 더 작은 n으로도 충분하고, 심하게 치우친 분포나 꼬리가 두꺼운 분포는 더 큰 n이 필요하다.

공정한 주사위 한 번의 눈은 1부터 6까지 균등하게 나오므로 정규 분포와 모양이 전혀 다르다. 평균은 3.5, 분산은 35/12(약 2.917)이다.

  • 주사위를 36번 던진 평균의 분산은 (35/12)/36 = 35/432, 약 0.081이다. 표준오차는 약 0.285이다.
  • 따라서 36번 던진 평균은 대략 N(3.5, 0.285²)을 따른다고 보고 계산할 수 있다.

모평균 1, 모표준편차 1인 지수 분포는 오른쪽으로 크게 치우친 분포(왜도 2)이다. 이 분포에서 n = 30인 표본을 10만 번 뽑아 표본평균을 구하는 모의실험을 Python(numpy)으로 해 보면 다음과 같다.

항목 이론값 모의실험 결과
표본평균의 평균 1 약 1.000
표본평균의 표준편차 1/√30, 약 0.183 약 0.182
표본평균의 왜도 2/√30, 약 0.365 약 0.364
  • 개별 관측치의 왜도는 2이지만 30개의 평균은 왜도가 약 0.36으로 줄어 정규 분포(왜도 0)에 훨씬 가까워진다. 다만 0이 되지는 않으므로, 치우침이 큰 분포에서는 n = 30도 근사일 뿐이다.
개념 관계
표본 분포 중심 극한 정리는 표본평균의 표본 분포가 어떤 모양인지 알려 준다.
통계적 추정 표본평균이 근사적으로 정규 분포를 따르므로 모평균의 구간 추정에 정규 분포나 t 분포를 쓸 수 있다.
신뢰구간 모평균의 신뢰구간 x¯±zα/2σn의 근거가 된다.
이항 분포 이항 분포는 베르누이 시행의 합이므로 n이 크면 정규 분포로 근사할 수 있다.
대수의 법칙 대수의 법칙은 n이 커지면 표본평균이 모평균에 가까워진다는 것(값의 수렴)이고, 중심 극한 정리는 그 주변에서 표본평균이 퍼지는 분포의 모양(분포의 수렴)을 말한다.
  • 표본평균의 기댓값은 μ, 분산은 σ²/n, 표준오차는 σ/√n이다. 표본 크기를 4배로 늘리면 표준오차는 절반이 된다.
  • 모집단 분포와 무관하게 성립한다. 모집단이 정규 분포여야 한다는 선지는 틀린 설명이다.
  • 정규 분포에 가까워지는 것은 모집단이나 개별 관측치가 아니라 표본평균의 분포이다.
  • n ≥ 30은 관례적인 기준이다.