빅데이터분석기사 필기 · 12회 변형(엑셀) · 어려움 난이도 · 61번

Q.61202612어려움 변형빅데이터 결과 해석

다음 <보기>의 결과에 대한 진단으로 가장 적절한 것은?

보기

양성 클래스 비율이 2%인 불균형 데이터에 SMOTE로 오버샘플링을 먼저 수행한 뒤, 그 결과를 학습·검증 데이터로 무작위 분할하였다.

검증 F1-Score는 0.95로 매우 높았으나, 실제 운영에 배포한 뒤의 F1-Score는 0.61에 그쳤다.

  • 1SMOTE는 원본을 그대로 복제하지 않고 새로운 값을 만들어 내므로 분할 전에 적용해도 누수가 발생하지 않는다.
  • 2검증 데이터에도 SMOTE를 동일하게 적용하면 두 성능 차이가 해소된다.
  • 3분할 전 SMOTE로 합성 표본이 검증 세트에도 들어간 누수이므로, 분할 이후 학습 데이터에만 적용해야 한다.
  • 4운영 성능 하락은 리샘플링과 무관하며 전적으로 데이터 드리프트 때문이다.

정답: 3 · 분할 전 SMOTE로 합성 표본이 검증 세트에도 들어간 누수이므로, 분할 이후 학습 데이터에만 적용해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기