빅데이터분석기사 필기 · 9회 변형(엑셀) · 어려움 난이도 · 40번

Q.4020249어려움 변형빅데이터 탐색

다음 <보기>는 고객 세분화를 위해 t-SNE로 그린 산점도의 관찰 결과이다. 이에 대한 해석으로 가장 적절한 것은?

보기
관찰내용
(가)화면에서 군집 A와 B는 멀리, A와 C는 가깝게 놓였다.
(나)군집 A의 점 덩어리가 D보다 훨씬 넓게 퍼져 보인다.
(다)perplexity를 5 → 50으로 바꾸자 군집의 배치와 모양이 크게 달라졌다.
(라)신규 고객 100명을 같은 좌표계에 그대로 얹으려 시도하였다.
  • 1(다)에서 결과가 달라진 것은 알고리즘의 결함이므로, 결과가 변하지 않는 perplexity 값을 찾을 때까지 조정해 하나의 정답 배치를 확정해야 한다.
  • 2(가)의 화면상 거리는 실제 유사도를 그대로 반영하고 (나)의 퍼진 정도는 군집 내 분산을 그대로 나타내므로, 두 관찰만으로 A가 이질적인 집단이라고 결론지을 수 있다.
  • 3t-SNE는 전역 구조를 정확히 보존하므로 군집 간 거리 비교에 가장 적합하며, 신규 데이터도 기존 좌표계에 그대로 추가하면 된다.
  • 4t-SNE는 국소 이웃을 보존하므로 군집 간 거리와 크기를 그대로 해석하면 안 되고 설정에 따른 변화도 정상이며, 신규 데이터는 그대로 얹을 수 없다.

정답: 4 · t-SNE는 국소 이웃을 보존하므로 군집 간 거리와 크기를 그대로 해석하면 안 되고 설정에 따른 변화도 정상이며, 신규 데이터는 그대로 얹을 수 없다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기