다음 <보기>의 결과에 대한 진단으로 가장 적절한 것은?
보기
고객 데이터 5개 변수에 표준화 없이 PCA를 적용한 결과이다.
| 변수 | 단위 | 표준편차 |
|---|---|---|
| 연소득 | 원 | 18,000,000 |
| 나이 | 세 | 12 |
| 구매 횟수 | 회 | 7 |
| 방문 일수 | 일 | 25 |
| 만족도 | 점(1~5) | 0.9 |
제1주성분의 설명 분산 비율이 99.98%로 나타났고, 제1주성분에 대한 연소득의 가중치가 거의 1, 나머지 변수의 가중치는 0에 가까웠다.
- 1제1주성분이 전체 분산의 99.98%를 설명하므로 차원 축소가 매우 성공적이며, 제1주성분 하나만으로 다섯 변수의 정보를 충분히 대표할 수 있다.
- 2설명 분산 비율이 99.98%로 지나치게 높은 것은 변수 간 상관이 전혀 없다는 뜻이므로, PCA를 적용할 수 없는 데이터임이 입증되었다.
- 3PCA는 분산 크기에 기반하는데 연소득 단위가 압도적으로 커서 제1주성분이 연소득으로 결정된 것이므로, 표준화 후 상관행렬 기반으로 수행해야 한다.
- 4연소득의 가중치가 1에 가까운 것은 연소득이 고객을 가장 잘 구분하는 핵심 변수라는 의미이므로, 나머지 네 변수는 분석에서 제거하는 것이 타당하다.
꿈라CBT