빅데이터분석기사 필기 · 12회 변형(엑셀) · 어려움 난이도 · 54번

Q.54202612어려움 변형빅데이터 모델링

다음 <보기>의 문제에 대한 설명으로 가장 적절한 것은?

보기

스팸 메일 분류기를 나이브 베이즈로 구현하였다.

그런데 학습 데이터의 정상 메일에는 '쿠폰'이라는 단어가 한 번도 등장하지 않았다. 그 결과 P(쿠폰 | 정상) = 0이 되어, '쿠폰'이 포함된 메일은 다른 단어가 아무리 정상적이어도 정상일 확률이 0으로 계산되었다.

  • 1'쿠폰'이 들어간 메일은 실제로 모두 스팸이므로 이 결과는 문제가 되지 않는다.
  • 2확률에 로그를 취해 합으로 계산하면 0 확률 문제가 자동으로 해결된다.
  • 3조건부 확률 하나가 0이면 사후확률이 0이 되므로 라플라스 스무딩이 필요하다.
  • 4조건부 독립 가정을 더 강하게 적용하면 0 확률 문제가 사라진다.

정답: 3 · 조건부 확률 하나가 0이면 사후확률이 0이 되므로 라플라스 스무딩이 필요하다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기