다음 <보기>의 문제에 대한 설명으로 가장 적절한 것은?
보기
스팸 메일 분류기를 나이브 베이즈로 구현하였다.
그런데 학습 데이터의 정상 메일에는 '쿠폰'이라는 단어가 한 번도 등장하지 않았다. 그 결과 P(쿠폰 | 정상) = 0이 되어, '쿠폰'이 포함된 메일은 다른 단어가 아무리 정상적이어도 정상일 확률이 0으로 계산되었다.
- 1'쿠폰'이 들어간 메일은 실제로 모두 스팸이므로 이 결과는 문제가 되지 않는다.
- 2확률에 로그를 취해 합으로 계산하면 0 확률 문제가 자동으로 해결된다.
- 3조건부 확률 하나가 0이면 사후확률이 0이 되므로 라플라스 스무딩이 필요하다.
- 4조건부 독립 가정을 더 강하게 적용하면 0 확률 문제가 사라진다.
꿈라CBT