3과목 · 사회통계·2장
확률과 확률분포
확률의 기본법칙, 조건부확률과 독립, 이항·포아송 분포, 정규분포와 표준정규분포를 다룹니다.
확률의 기본
- 0 ≤ P(A) ≤ 1, P(전체) = 1
- 여사건: P(A°) = 1 − P(A)
- 덧셈법칙: P(A∪B) = P(A) + P(B) − P(A∩B)
- **배반사건(상호배타)**이면 P(A∩B) = 0 → P(A∪B) = P(A) + P(B)
- 곱셈법칙: P(A∩B) = P(A) × P(B|A)
- 독립사건이면 P(A∩B) = P(A) × P(B)
배반과 독립은 다릅니다. 배반은 동시에 일어날 수 없는 것, 독립은 한쪽이 다른 쪽 확률에 영향을 주지 않는 것입니다. 배반사건은 (확률이 0이 아니면) 오히려 독립이 아닙니다.
조건부확률
P(B|A) = P(A∩B) / P(A)
베이즈 정리
P(A|B) = P(B|A)·P(A) / P(B)
사전확률 P(A)를 자료 B로 갱신해 사후확률 P(A|B)를 얻습니다. 검사의 정확도가 높아도 유병률이 낮으면 양성일 때 실제 환자일 확률은 낮다는 결론이 여기서 나옵니다.
이산확률분포
이항분포 B(n, p)
성공확률 p인 독립 시행을 n번 할 때 성공 횟수.
- 평균 = np, 분산 = np(1−p)
- 조건: 시행이 독립, 각 시행의 성공확률 일정, 결과가 성공/실패 두 가지
- n이 크고 p가 0.5 근처면 정규분포로 근사
포아송분포
단위 시간·공간에서 드물게 발생하는 사건의 횟수.
- 평균 = 분산 = λ
- 예: 1시간당 콜센터 수신 건수, 1페이지당 오타 수
- 이항분포에서 n이 크고 p가 매우 작을 때(np = λ) 포아송으로 근사
연속확률분포
정규분포 N(μ, σ²)
- 좌우대칭 종모양, 평균=중앙값=최빈값
- 곡선 아래 전체 면적 = 1
- 68 − 95 − 99.7 법칙: μ±1σ에 약 68%, μ±2σ에 약 95%, μ±3σ에 약 99.7%
표준정규분포 N(0, 1)
z = (X − μ) / σ 로 표준화합니다.
자주 쓰는 z값:
| 신뢰수준 | z |
|---|---|
| 90% | 1.645 |
| 95% | 1.96 |
| 99% | 2.576 |
95% → 1.96은 반드시 외워야 합니다. 신뢰구간·검정 문제에서 계속 쓰입니다.
t분포
모분산을 모르고 표본이 작을 때 사용합니다.
- 정규분포보다 꼬리가 두껍고 납작
- **자유도(df)**가 커지면 정규분포에 수렴
- 자유도: 단일표본 n−1
카이제곱분포·F분포
- 카이제곱: 분산 추정, 적합도·독립성 검정. 오른쪽으로 치우친 비대칭 분포
- F분포: 두 분산의 비. 분산분석에 사용. 비대칭
확률변수의 기대값과 분산
- E(aX + b) = aE(X) + b
- Var(aX + b) = a²Var(X) — 상수 b는 분산에 영향 없음
- 독립일 때 Var(X + Y) = Var(X) + Var(Y)
이 성질들은 계산 문제로 직접 출제됩니다.