다음 <보기>의 상황에 대한 진단으로 가장 적절한 것은?
보기
월별 매출을 예측하는 시계열 모델을 개발하면서, 전체 기간의 데이터를 무작위로 섞어 5-Fold 교차검증을 수행하였다.
교차검증 성능은 MAPE 4.2%로 매우 우수했으나, 실제 운영에서 다음 달을 예측한 결과는 MAPE 18.7%로 크게 나빠졌다.
- 1무작위 K-Fold는 미래로 과거를 예측하는 누수이므로 시계열 검증을 쓴다.
- 2시계열 데이터에서도 무작위 분할이 표준이므로 원인은 다른 곳에서 찾아야 한다.
- 3K를 5에서 10으로 늘리면 시간 순서 문제가 자연스럽게 해결된다.
- 4교차검증 대신 홀드아웃으로 무작위 분할하면 이 문제는 발생하지 않는다.
꿈라CBT