다음 <보기>는 세 문서의 단어 빈도 벡터이다. 이에 대한 해석으로 가장 적절한 것은?
보기
| 문서 | 데이터 | 분석 | 모형 | 총 단어 수 |
|---|---|---|---|---|
| D1 | 3 | 2 | 1 | 6 |
| D2 | 30 | 20 | 10 | 60 |
| D3 | 1 | 2 | 5 | 8 |
D2는 D1과 같은 주제의 긴 문서이며, 단어 비율이 D1과 동일하다.
- 1D1과 D2는 유클리드 거리가 멀기 때문에 서로 다른 주제의 문서로 판정해야 하며, 코사인 유사도는 문서 길이를 무시하므로 신뢰할 수 없다.
- 2D1과 D2는 비율이 같아 코사인 유사도가 1이지만 유클리드 거리는 크므로, 주제 비교에는 코사인 유사도가 적절하고 TF-IDF도 유용하다.
- 3세 문서 모두 같은 세 단어로 이루어져 있으므로 자카드 유사도는 1이고, 이는 세 문서가 모두 같은 주제임을 의미한다.
- 4D3은 총 단어 수가 D1과 비슷하므로 D1과 가장 유사한 문서이며, 단어 구성은 유사도 판단에 영향을 주지 않는다.
꿈라CBT