다음 <보기>에서 설명하는 자연어 처리 기법으로 가장 적절한 것은?
보기
문서와 단어의 관계를 행은 문서, 열은 단어인 거대한 행렬로 표현하면, 대부분의 칸이 0인 매우 크고 희소한 행렬이 만들어진다.
이 행렬에 특이값 분해(SVD)를 적용해 특이값이 큰 상위 k개 성분만 남기면, 원래 행렬을 훨씬 낮은 차원으로 근사할 수 있다.
이렇게 얻은 저차원 공간에서는 '자동차'와 '승용차'처럼 함께 쓰이는 단어들이 서로 가까이 놓여, 표기가 달라도 의미가 비슷한 문서를 찾아낼 수 있다.
- 1비음수 행렬 분해(NMF)
- 2잠재 디리클레 할당(LDA)
- 3잠재 의미 분석(LSA)
- 4상관 주제 모델(CTM)
꿈라CBT