빅데이터분석기사 필기 · 9회 변형(엑셀) · 어려움 난이도 · 52번

Q.5220249어려움 변형빅데이터 모델링

다음 <보기>는 세 문서의 단어 빈도 벡터이다. 이에 대한 해석으로 가장 적절한 것은?

보기
문서데이터분석모형총 단어 수
D13216
D230201060
D31258

D2는 D1과 같은 주제의 긴 문서이며, 단어 비율이 D1과 동일하다.

  • 1D1과 D2는 유클리드 거리가 멀기 때문에 서로 다른 주제의 문서로 판정해야 하며, 코사인 유사도는 문서 길이를 무시하므로 신뢰할 수 없다.
  • 2D1과 D2는 비율이 같아 코사인 유사도가 1이지만 유클리드 거리는 크므로, 주제 비교에는 코사인 유사도가 적절하고 TF-IDF도 유용하다.
  • 3세 문서 모두 같은 세 단어로 이루어져 있으므로 자카드 유사도는 1이고, 이는 세 문서가 모두 같은 주제임을 의미한다.
  • 4D3은 총 단어 수가 D1과 비슷하므로 D1과 가장 유사한 문서이며, 단어 구성은 유사도 판단에 영향을 주지 않는다.

정답: 2 · D1과 D2는 비율이 같아 코사인 유사도가 1이지만 유클리드 거리는 크므로, 주제 비교에는 코사인 유사도가 적절하고 TF-IDF도 유용하다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기