Lecture 22. 확률적 모델링
개요
핵심 질문
- 확률 분포는 AI에서 무엇을 표현하는가?
- MLE는 손실 함수와 어떻게 연결되는가?
- KL 발산과 엔트로피는 어디에 쓰이는가?
- 베이즈 추론은 딥러닝과 어떤 관계인가?
학습 목표
- 확률 공리·조건부 확률·베이즈 정리를 설명할 수 있다.
- 주요 확률 분포의 정의·평균·분산과 AI 적용처를 연결할 수 있다.
- MLE가 손실 함수 유도의 기반임을 수식으로 이해한다.
- KL 발산·엔트로피·크로스 엔트로피의 관계를 설명할 수 있다.
핵심 개념
1. 확률의 기초
확률 공리 (Kolmogorov)
결합·주변·조건부 확률
독립과 배반
- 독립:
- 배반(서로소):
전확률 공식
베이즈 정리 (Bayes' Theorem)
- : 사전 확률 (Prior) — 데이터 관측 전 파라미터에 대한 믿음
- : 우도 (Likelihood) — 파라미터가 주어졌을 때 데이터가 나올 확률
- : 사후 확률 (Posterior) — 데이터를 관측한 후 업데이트된 믿음
- : 증거 (Evidence) — 정규화 상수
AI에서의 사용
- 판별 모델: 를 직접 모델링
- 생성 모델: 로 분해 → 베이즈 정리로 연결
- 베이지안 최적화: 하이퍼파라미터 탐색 시 사후 확률 업데이트
2. 확률 변수와 확률 분포
확률 변수 (Random Variable)
- 이산형: 가능한 값의 종류를 셀 수 있음 → 확률 질량 함수(PMF)
- 연속형: 가능한 값의 종류를 셀 수 없음 → 확률 밀도 함수(PDF)
이산형 PMF 조건
연속형 PDF 조건
독립 항등 분포 (i.i.d.)
머신러닝에서 훈련 데이터는 대부분 i.i.d.를 가정한다. 각 샘플이 독립이고 동일한 분포를 따르면 결합 확률을 곱으로 분해할 수 있다.
3. 이산형 확률 분포
베르누이 분포 (Bernoulli)
AI 사용: 이진 분류의 출력층. 시그모이드 활성 함수 → 베르누이 파라미터 추정.
이항 분포 (Binomial)
AI 사용: 베르누이 시행의 합. 이진 분류를 번 시행하는 모델링.
카테고리 분포 (Categorical)
AI 사용: 다중 분류의 출력층. 소프트맥스 활성 함수 → 카테고리 분포 파라미터 추정.
포아송 분포 (Poisson)
AI 사용: 단위 시간 내 이벤트 발생 횟수 모델링. 이상치 탐지, 카운트 데이터.
이항 분포의 포아송 근사: , , 고정 시 .
4. 연속형 확률 분포
가우시안 분포 (Normal/Gaussian)
표준 정규 분포: .
다변량 가우시안
공분산 행렬 는 반드시 양반정치(PSD)이어야 한다.
AI 사용: 회귀 노이즈 모델 → MLE = MSE 유도 (아래 §6 참고). VAE의 잠재 사전 분포 . 배치 정규화 목표 분포.
정규 근사: 이 커지면 분포에 무관하게 표본 평균이 정규 분포에 수렴 (중심 극한 정리).
연속형 균일 분포 (Uniform)
AI 사용: 가중치 초기화(Xavier 초기화), 하이퍼파라미터 랜덤 서치.
라플라스 분포 (Laplace)
AI 사용: 정규화의 사전 분포. MAP 추정에서 라플라스 사전 분포 → Lasso 손실.
감마 분포 (Gamma)
- 지수 분포: 인 특수 케이스 (, )
- 카이제곱 분포: , 인 특수 케이스 (, )
베타 분포 (Beta)
AI 사용: 베르누이/이항 분포의 켤레 사전 분포. 베이지안 추론에서 확률 파라미터의 분포 표현.
5. 기댓값, 분산, 공분산
기댓값 (Expectation)
분산 (Variance)
공분산 (Covariance)
상관 계수 (Correlation)
표본 통계량
AI에서의 사용
- 배치 정규화: 미니배치의 평균·분산으로 활성화 정규화
- 공분산 행렬: PCA의 핵심 — 특성 간 선형 관계 파악
- 분산 감소: Actor-Critic에서 어드밴티지 함수로 Policy Gradient 분산 감소
6. 최대우도추정 (MLE)
정의
주어진 데이터가 나올 확률(우도)을 최대화하는 파라미터를 찾는 것.
수치 안정성과 계산 편의를 위해 로그 우도 사용:
MLE → 손실 함수 유도
회귀 (가우시안 노이즈 가정)
가우시안 노이즈 가정 → MLE = MSE 최소화.
이진 분류 (베르누이 가정)
다중 분류 (카테고리 가정)
MLE = KL 발산 최소화
MLE는 데이터 분포와 모델 분포 사이의 KL 발산을 최소화하는 것과 수학적으로 동치다.
최대 사후 추정 (MAP)
MLE에 사전 분포를 추가한 형태:
- 가우시안 사전 분포 → MAP = 정규화 (Ridge)
- 라플라스 사전 분포 → MAP = 정규화 (Lasso)
7. 정보 이론
정보량 (Self-Information)
사건 확률이 낮을수록 정보량이 크다.
엔트로피 (Entropy)
확률 분포의 불확실성(랜덤성)을 측정:
- 모든 사건이 동일 확률: 엔트로피 최대
- 하나의 사건이 확실: 엔트로피 = 0
크로스 엔트로피 (Cross Entropy)
분포 를 기준으로 분포 의 정보량에 대한 기댓값:
KL 발산 (Kullback-Leibler Divergence)
두 분포 사이의 비유사도(비대칭):
.
(비대칭).
세 개념의 관계:
AI에서의 사용
- 분류 손실: 레이블 분포 = 원-핫, 예측 분포 = 소프트맥스 출력 → Cross Entropy 최소화 = KL 발산 최소화
- VAE: ELBO의 KL 항 — 잠재 분포를 표준 가우시안에 가깝게 유지
- RLHF: KL 페널티 — 정렬 과정에서 정책이 기준 모델에서 너무 멀리 벗어나지 않도록 제한
- 지식 증류: 학생 모델과 교사 모델의 출력 분포 간 KL 발산 최소화
- 언어 모델 Perplexity: — 모델이 실제 분포를 얼마나 잘 예측하는지의 지표
8. 조건부 확률과 마르코프 연쇄
조건부 독립
마르코프 성질 (Markov Property)
현재 상태만으로 미래를 결정한다 — 과거 이력 불필요.
전이 확률 행렬
-step 전이: .
AI에서의 사용
- 강화학습 MDP: 마르코프 성질이 핵심 가정 — 현재 상태 만으로 다음 상태 결정
- 언어 모델 (N-gram): N-1차 마르코프 가정으로 다음 단어 확률 추정
- MCMC 샘플링: 마르코프 체인으로 복잡한 사후 분포에서 샘플 추출
9. 몬테카를로 방법
기본 원리
기댓값을 랜덤 샘플의 평균으로 추정:
대수의 법칙에 의해 이면 추정값이 실제 기댓값에 수렴한다.
MCMC (Markov Chain Monte Carlo)
직접 샘플링이 어려운 복잡한 분포 에서 마르코프 체인을 이용해 샘플 추출.
메트로폴리스-헤이스팅스 채택 비율:
을 추출하여 이면 채택, 아니면 현재 유지.
AI에서의 사용
- 베이지안 추론: 해석적으로 계산 불가능한 사후 분포 에서 샘플 추출
- 데이터 증강: 학습 분포에서 새로운 샘플 생성
- 적분 추정: 고차원 적분을 샘플링으로 근사 — 강화학습 기댓값 추정
수식 정리
베이즈 정리
주요 분포 요약
| 분포 | AI 적용 | ||
|---|---|---|---|
| 이진 분류 출력 | |||
| 다중 분류 출력 | |||
| 회귀, VAE 잠재 분포 | |||
| 정규화 사전 분포 | |||
| 대기 시간 모델링 |
MLE → 손실 함수
정보 이론
MAP와 정규화
중심 극한 정리