빅데이터분석기사 필기 · 10회 변형(엑셀) · 어려움 난이도 · 28번

Q.28202510어려움 변형빅데이터 탐색

다음 <보기>의 결과에 대한 진단으로 가장 적절한 것은?

보기

고객 데이터 5개 변수에 표준화 없이 PCA를 적용한 결과이다.

변수단위표준편차
연소득18,000,000
나이12
구매 횟수7
방문 일수25
만족도점(1~5)0.9

제1주성분의 설명 분산 비율이 99.98%로 나타났고, 제1주성분에 대한 연소득의 가중치가 거의 1, 나머지 변수의 가중치는 0에 가까웠다.

  • 1제1주성분이 전체 분산의 99.98%를 설명하므로 차원 축소가 매우 성공적이며, 제1주성분 하나만으로 다섯 변수의 정보를 충분히 대표할 수 있다.
  • 2설명 분산 비율이 99.98%로 지나치게 높은 것은 변수 간 상관이 전혀 없다는 뜻이므로, PCA를 적용할 수 없는 데이터임이 입증되었다.
  • 3PCA는 분산 크기에 기반하는데 연소득 단위가 압도적으로 커서 제1주성분이 연소득으로 결정된 것이므로, 표준화 후 상관행렬 기반으로 수행해야 한다.
  • 4연소득의 가중치가 1에 가까운 것은 연소득이 고객을 가장 잘 구분하는 핵심 변수라는 의미이므로, 나머지 네 변수는 분석에서 제거하는 것이 타당하다.

정답: 3 · PCA는 분산 크기에 기반하는데 연소득 단위가 압도적으로 커서 제1주성분이 연소득으로 결정된 것이므로, 표준화 후 상관행렬 기반으로 수행해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기