다음 <보기>는 학습 데이터의 양을 늘려 가며 측정한 학습곡선이다. 이에 대한 진단과 대응으로 가장 적절한 것은?
보기
| 학습 데이터 수 | 학습 오차 | 검증 오차 |
|---|---|---|
| 1,000 | 0.29 | 0.34 |
| 5,000 | 0.31 | 0.33 |
| 20,000 | 0.32 | 0.33 |
| 80,000 | 0.32 | 0.32 |
사람이 같은 과제를 수행할 때의 오차는 약 0.08로 알려져 있다.
- 1학습 오차와 검증 오차가 0.32로 수렴했으므로 모형이 최적 상태에 도달한 것이며, 더 이상 개선할 여지가 없다.
- 2두 오차가 0.32에서 함께 수렴해 사람의 0.08과 차이가 크므로 데이터 부족이 아닌 과소적합이며, 모형 복잡도를 키워야 한다.
- 3검증 오차가 학습 오차보다 항상 크거나 같으므로 전형적인 과대적합이며, 드롭아웃과 가중치 규제를 강화해야 한다.
- 4데이터를 80,000건에서 400,000건으로 다섯 배 더 늘리면 두 오차가 모두 0.08 수준까지 낮아질 것이므로 데이터 수집을 최우선으로 진행해야 한다.
꿈라CBT