다음 <보기>는 고객 데이터를 저장하는 과정에서 이루어진 변환이다. 이에 대한 설명으로 가장 적절한 것은?
보기
| 단계 | 변환 내용 | 저장 형태 |
|---|---|---|
| 원본 | 연간 구매 금액을 원 단위로 수집 | 1,247,300원 등 |
| 1차 | 5개 구간으로 나누어 등급 부여 (1등급: 최상위 20% ~ 5등급: 하위 20%) | 1 / 2 / 3 / 4 / 5 |
| 2차 | 등급을 '우수'/'일반' 두 범주로 통합 | 우수 / 일반 |
원본 금액은 저장 공간 확보를 위해 삭제되었으며, 이후 평균 구매 금액을 산출해야 하는 요구가 발생하였다.
- 1척도는 하위로만 변환되고 잃은 정보는 되돌릴 수 없어 평균 구매 금액을 산출할 수 없으므로, 수집 단계에서 상위 척도의 원본을 보존해야 한다.
- 22차 변환 결과는 두 범주뿐이지만 '우수'를 1, '일반'을 0으로 코딩하면 비율 척도가 되므로, 그 평균이 곧 평균 구매 금액을 의미한다.
- 31차 변환 결과인 등급은 숫자로 저장되어 있으므로 평균 등급을 구한 뒤 구간의 중앙값을 대입하면 원래의 평균 구매 금액을 정확히 복원할 수 있다.
- 4등급화와 범주화는 값을 요약할 뿐 정보를 잃지 않으므로, 저장 공간이 부족하면 원본을 삭제하고 등급만 남기는 것이 표준적인 관행이다.
꿈라CBT