다음 <보기>의 파생변수 설계에 대한 지적으로 가장 적절한 것은?
보기
보험사가 6개월 내 해지 여부를 예측하는 모형을 만들며 다음 변수를 생성하였다.
| 변수 | 정의 |
|---|---|
| V1 | 가입일부터 해지 시점까지의 총 납입 횟수 |
| V2 | 해지 방어 상담 이력 유무(있음/없음) |
| V3 | 기준일 직전 3개월 청구액 평균 |
| V4 | V3을 가입 시점 월 보험료로 나눈 비율 |
검증 데이터에서 AUC 0.98이 나왔으나, 실제 운영에서는 예측이 거의 맞지 않았다.
- 1V1과 V2는 해지 이후에야 확정되는 미래 정보를 학습에 쓴 타깃 누수이므로, 기준 시점 이전 정보만 써야 한다.
- 2V3과 V4는 서로 상관이 높아 다중공선성이 발생한 것이 유일한 원인이므로, 둘 중 하나만 남기면 운영 성능이 회복된다.
- 3AUC 0.98은 모형이 과소적합되었다는 신호이므로, 변수 정의는 그대로 두고 더 복잡한 알고리즘으로 교체해야 한다.
- 4V4는 서로 다른 시점의 값을 나눈 비율이므로 계산 자체가 불가능하며, 이 변수만 제거하면 문제가 해결된다.
꿈라CBT