다음 <보기>는 리뷰 감성 분석의 전처리 설정을 바꾸며 실험한 결과이다. 이에 대한 진단으로 가장 적절한 것은?
보기
| 설정 | 전처리 내용 | 정확도 | 오분류 사례 |
|---|---|---|---|
| ㉠ | 토큰화 + 일반 불용어 목록 전면 적용 | 0.71 | “전혀 좋지 않다” → 긍정으로 판정 |
| ㉡ | 토큰화 + 불용어 목록에서 부정어를 제외 | 0.86 | 크게 감소 |
| ㉢ | ㉡ + 어간 추출 적용 | 0.87 | 어휘 수 32,000 → 19,000 |
- 1㉠의 오분류는 학습 데이터가 부족해서 생긴 것이므로, 전처리와 무관하게 데이터를 늘리면 자동으로 해결된다.
- 2불용어는 언제나 많이 제거할수록 잡음이 줄어 성능이 좋아지므로, ㉡의 개선은 우연이며 부정어도 제거하는 편이 원칙적으로 옳다.
- 3일반 불용어 목록의 부정어를 제거하면 의미가 뒤집히므로 목록을 목적에 맞게 조정해야 하고, 어간 추출은 희소성을 줄인다.
- 4㉢에서 어휘 수가 줄어든 것은 정보 손실이므로 정확도가 떨어져야 하는데 오히려 올랐으므로, 표에 오류가 있다고 보아야 한다.
꿈라CBT