빅데이터분석기사 필기 · 9회 변형(엑셀) · 어려움 난이도 · 46번

Q.4620249어려움 변형빅데이터 모델링

다음 <보기>는 리뷰 감성 분석의 전처리 설정을 바꾸며 실험한 결과이다. 이에 대한 진단으로 가장 적절한 것은?

보기
설정전처리 내용정확도오분류 사례
토큰화 + 일반 불용어 목록 전면 적용0.71전혀 좋지 않다” → 긍정으로 판정
토큰화 + 불용어 목록에서 부정어를 제외0.86크게 감소
㉡ + 어간 추출 적용0.87어휘 수 32,000 → 19,000
  • 1㉠의 오분류는 학습 데이터가 부족해서 생긴 것이므로, 전처리와 무관하게 데이터를 늘리면 자동으로 해결된다.
  • 2불용어는 언제나 많이 제거할수록 잡음이 줄어 성능이 좋아지므로, ㉡의 개선은 우연이며 부정어도 제거하는 편이 원칙적으로 옳다.
  • 3일반 불용어 목록의 부정어를 제거하면 의미가 뒤집히므로 목록을 목적에 맞게 조정해야 하고, 어간 추출은 희소성을 줄인다.
  • 4㉢에서 어휘 수가 줄어든 것은 정보 손실이므로 정확도가 떨어져야 하는데 오히려 올랐으므로, 표에 오류가 있다고 보아야 한다.

정답: 3 · 일반 불용어 목록의 부정어를 제거하면 의미가 뒤집히므로 목록을 목적에 맞게 조정해야 하고, 어간 추출은 희소성을 줄인다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기