빅데이터분석기사 필기 · 10회 변형(엑셀) · 어려움 난이도 · 24번

Q.24202510어려움 변형빅데이터 탐색

다음 <보기>의 절차와 결과에 대한 진단으로 가장 적절한 것은?

보기

카드 사기 탐지 모형을 만들었다. 전체 100만 건 중 사기는 3,000건(0.3%)이다.

  1. 전체 데이터에 SMOTE를 적용해 사기 : 정상을 1 : 1로 맞추었다.
  2. 그 결과를 학습 7 : 검증 3으로 분할하였다.
  3. 검증 데이터에서 정확도(Accuracy) 0.97을 얻어 성능이 우수하다고 보고하였다.

그러나 실제 운영에서는 사기 건의 상당수를 놓쳤고, 재현율(Recall)은 0.31에 그쳤다.

  • 1정확도 0.97은 충분히 높은 값이므로 모형에는 문제가 없고, 운영 환경의 사기 수법이 학습 시점과 달라진 것이 유일한 원인이다.
  • 2SMOTE 대신 소수 클래스를 단순 복제하는 랜덤 오버 샘플링으로 바꾸면 합성 데이터가 사라지므로 누수와 지표 왜곡이 모두 해결된다.
  • 3불균형 데이터에서는 정확도가 가장 신뢰할 수 있는 지표이므로, 재현율이 낮은 것은 임계값을 0.5보다 높게 올리면 개선된다.
  • 4SMOTE를 분할 전에 적용한 누수이고 1:1 검증의 정확도도 실제 분포를 대변하지 못하므로, 재현율·PR-AUC로 평가해야 한다.

정답: 4 · SMOTE를 분할 전에 적용한 누수이고 1:1 검증의 정확도도 실제 분포를 대변하지 못하므로, 재현율·PR-AUC로 평가해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기