빅데이터분석기사 필기 · 11회 변형(엑셀) · 어려움 난이도 · 52번

Q.52202511어려움 변형빅데이터 모델링

다음 <보기>의 결과에 대한 진단으로 가장 적절한 것은?

보기

TF-IDF로 문서 벡터를 만들어 유사도를 계산하였다.

  • 고객이 상담원에게 항의했다’와 ‘상담원이 고객에게 항의했다’가 유사도 1.0으로 나왔다.
  • 자동차’와 ‘승용차’만 다른 두 문서는 유사도가 매우 낮게 나왔다.
  • 1IDF 계산에 사용한 로그의 밑을 자연로그로 바꾸면 두 현상이 모두 해결된다.
  • 2두 현상 모두 불용어 제거가 되지 않아 생긴 것이므로 불용어 사전을 보강하면 된다.
  • 3어순을 반영하지 못하고 동의어를 별개로 처리하므로, 임베딩을 함께 검토해야 한다.
  • 4문서 길이를 모두 같게 맞추면 어순과 동의어 문제가 함께 해결된다.

정답: 3 · 어순을 반영하지 못하고 동의어를 별개로 처리하므로, 임베딩을 함께 검토해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기