다음 <보기>의 결과에 대한 해석으로 가장 적절한 것은?
보기
뉴스 기사 3만 건의 단어-문서 행렬(단어 4만 개)에 LSA를 적용하며 차원 k를 바꿔 가며 실험하였다.
| k | 누적 설명 분산 | 유사 문서 검색 성능 |
|---|---|---|
| 10 | 18% | 낮음 — 서로 다른 주제가 한 축에 뭉침 |
| 200 | 61% | 가장 높음 |
| 3,000 | 96% | 낮음 — 표기가 다른 동의어를 다시 구별 |
또한 k = 200에서 얻은 축들은 어떤 의미인지 이름 붙이기 어려웠고, 일부 축에는 음수 값이 나타났다.
- 1누적 설명 분산이 높을수록 정보 손실이 적으므로 k = 3,000이 최적이며, 검색 성능이 낮은 것은 문서 수가 부족하기 때문이다.
- 2차원을 너무 줄이면 서로 다른 의미가 섞이고 너무 늘리면 동의어 효과가 사라지므로, k는 설명 분산이 아니라 목적 성능으로 정해야 한다.
- 3축에 음수가 나타난 것은 계산 오류이므로 행렬을 정규화한 뒤 SVD를 다시 수행해야 하며, 그렇게 하면 k = 3,000에서도 검색 성능이 회복된다.
- 4k가 커질수록 동의어를 더 잘 묶어 주므로 검색 성능은 단조 증가해야 하며, k = 3,000의 성능 저하는 우연한 측정 오차로 보아야 한다.
꿈라CBT