빅데이터분석기사 필기 · 12회 변형(엑셀) · 어려움 난이도 · 68번

Q.68202612어려움 변형빅데이터 결과 해석

다음 <보기>의 상황에 대한 진단으로 가장 적절한 것은?

보기

월별 매출을 예측하는 시계열 모델을 개발하면서, 전체 기간의 데이터를 무작위로 섞어 5-Fold 교차검증을 수행하였다.

교차검증 성능은 MAPE 4.2%로 매우 우수했으나, 실제 운영에서 다음 달을 예측한 결과는 MAPE 18.7%로 크게 나빠졌다.

  • 1무작위 K-Fold는 미래로 과거를 예측하는 누수이므로 시계열 검증을 쓴다.
  • 2시계열 데이터에서도 무작위 분할이 표준이므로 원인은 다른 곳에서 찾아야 한다.
  • 3K를 5에서 10으로 늘리면 시간 순서 문제가 자연스럽게 해결된다.
  • 4교차검증 대신 홀드아웃으로 무작위 분할하면 이 문제는 발생하지 않는다.

정답: 1 · 무작위 K-Fold는 미래로 과거를 예측하는 누수이므로 시계열 검증을 쓴다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기