포아송 분포
IT 위키
더 많은 작업
- Poisson Distribution; 푸아송 분포
- 정해진 시간이나 공간 안에서 어떤 사건이 일어나는 횟수를 나타내는 이산형 확률 분포
단위 시간, 단위 면적, 단위 길이 등 정해진 구간 안에서 사건이 평균 λ번 일어날 때, 실제로 x번 일어날 확률을 나타낸다. 모수는 λ(람다) 하나뿐이며, 평균과 분산이 모두 λ로 같다는 점이 가장 큰 특징이다. 시행 횟수 n이 크고 성공 확률 p가 작은 이항 분포의 근사로도 쓰인다. 표기는 흔히 X ~ Poisson(λ) 또는 Po(λ)로 쓴다.
- λ > 0은 정해진 구간에서 사건이 일어나는 평균 횟수이다.
- x는 0 이상의 정수이며 상한이 없다.
- 누적분포함수는 이다.
| 통계량 | 값 |
|---|---|
| 평균 | λ |
| 분산 | λ |
| 표준편차 | √λ |
| 왜도 | 1/√λ (항상 양수, 오른쪽 꼬리) |
| 최빈값 | λ가 정수가 아니면 λ보다 작은 가장 큰 정수, λ가 정수이면 λ와 λ − 1 두 개 |
| 모수 추정 | λ의 최대가능도 추정량은 표본평균이다. |
- λ가 작으면 0 근처에 몰린 오른쪽으로 치우친 모양이고, λ가 커질수록 대칭에 가까워져 정규 분포 N(λ, λ)로 근사할 수 있다.
- 한 구간에서 일어나는 사건 수는 겹치지 않는 다른 구간의 사건 수와 독립이다.
- 사건이 일어나는 평균 비율이 구간 안에서 일정하다. 구간 길이가 두 배이면 평균 횟수도 두 배가 된다.
- 아주 짧은 구간에서 사건이 두 번 이상 동시에 일어날 확률은 무시할 만큼 작다.
- 콜센터에 한 시간 동안 걸려 오는 전화 수
- 웹 서버에 1분 동안 들어오는 요청 수
- 하루 동안 특정 교차로에서 일어나는 사고 건수
- 책 한 쪽에 있는 오타 수, 옷감 1m²에 있는 흠집 수
- 1년 동안 보험사에 접수되는 특정 유형의 청구 건수
이항 분포 B(n, p)에서 n이 크고 p가 작으면서 np = λ가 일정하게 유지되면, 이항 분포는 평균 λ인 포아송 분포에 가까워진다. 이항 분포의 분산 np(1 − p)는 p가 0에 가까우면 np와 거의 같아지므로 평균과 분산이 같은 포아송 분포의 성질과도 맞는다.
예를 들어 불량률 0.3%인 제품 1,000개 중 불량품 수는 이항 분포 B(1000, 0.003)을 따르고 np = 3이다. scipy로 계산하면 다음과 같다.
| 불량품 수 x | 이항 분포 B(1000, 0.003) | 포아송 분포 λ = 3 |
|---|---|---|
| 0 | 약 0.0496 | 약 0.0498 |
| 2 | 약 0.2242 | 약 0.2240 |
어느 콜센터에 한 시간 동안 평균 3통의 전화가 온다(λ = 3). 전화 수가 포아송 분포를 따른다고 할 때 확률은 다음과 같다(scipy로 검산한 값).
- 한 시간 동안 전화가 한 통도 오지 않을 확률:
- 정확히 1통 올 확률:
- 정확히 2통 올 확률:
- 2통 이하일 확률:
- 1통 이상 올 확률:
- 평균이 3이므로 분산도 3, 표준편차는 √3, 약 1.73이다.
- 두 시간으로 구간을 늘리면 λ = 6인 포아송 분포를 쓴다.
| 항목 | 이항 분포 | 포아송 분포 | 정규 분포 |
|---|---|---|---|
| 유형 | 이산형 | 이산형 | 연속형 |
| 확률변수 | n번 시행 중 성공 횟수 | 정해진 구간의 사건 발생 횟수 | 연속적인 측정값 |
| 값의 범위 | 0, 1, …, n | 0, 1, 2, … (상한 없음) | −∞ ~ ∞ |
| 모수 | n, p | λ | μ, σ² |
| 평균 | np | λ | μ |
| 분산 | np(1 − p) | λ | σ² |
| 특징 | 분산이 평균보다 작다(0 < p < 1일 때) | 평균 = 분산 | 평균에 대해 좌우 대칭 |
| 근사 관계 | n이 크고 p가 작으면 포아송, np와 n(1 − p)가 충분히 크면 정규 분포로 근사 | λ가 크면 정규 분포로 근사 | 중심 극한 정리에 의해 많은 분포의 극한 |
- 평균과 분산이 모두 λ로 같다.
- 단위 시간·단위 공간당 사건 발생 횟수를 나타내는 이산형 분포이다. 연속형 분포와 구분한다.
- 이항 분포에서 n이 크고 p가 작을 때 np = λ로 두어 근사한다.
- P(X = 0) = e−λ, P(X ≥ 1) = 1 − e−λ 처럼 확률질량함수에 값을 넣어 식을 세우는 방법을 익혀 둔다. 시험에서는 계산기를 쓸 수 없으므로 e−λ가 들어간 식의 형태로 이해해 두는 것이 좋다.