다음 <보기>는 사기 거래 탐지 모형의 실험 기록이다. 이에 대한 진단으로 가장 적절한 것은?
보기
전체 20만 건 중 사기 0.4%. 분석가는 전체 데이터에 SMOTE를 먼저 적용해 1:1로 맞춘 뒤, 그 데이터를 5-겹 교차검증으로 나누어 학습·검증하였다.
| 구분 | 정확도 | 재현율 | PR-AUC |
|---|---|---|---|
| 교차검증(SMOTE 후 분할) | 0.97 | 0.96 | 0.98 |
| 실제 운영 데이터 | 0.99 | 0.31 | 0.22 |
- 1운영 데이터의 정확도가 0.99로 더 높으므로 모형은 정상이며, 재현율 하락은 운영 환경의 사기 유형이 달라졌기 때문이므로 재학습만 하면 된다.
- 2SMOTE를 분할 전에 적용해 합성 관측치가 학습·검증 폴드에 나뉘어 들어간 데이터 누출이므로, 표본 조정은 분할 이후 학습 폴드에만 적용해야 한다.
- 3SMOTE는 원본 데이터를 그대로 복제하는 기법이 아니라 새로운 값을 합성하므로 데이터 누출이 발생할 수 없으며, 분할 전후 어디에 적용해도 결과는 동일하다.
- 4불균형 데이터에서는 정확도가 가장 신뢰할 수 있는 지표이므로, 재현율과 PR-AUC의 차이는 무시하고 정확도 0.99를 근거로 모형을 배포해도 무방하다.
꿈라CBT