다음 <보기>의 비용복잡도 가지치기 결과에 대한 해석으로 가장 적절한 것은?
보기
나무를 끝까지 키운 뒤 복잡도 파라미터 \(\alpha\)를 바꿔 가며 가지치기하고, 각 결과를 5겹 교차검증으로 평가하였다.
| \(\alpha\) | 잎 노드 수 | 학습 오차 | 교차검증 오차 |
|---|---|---|---|
| 0.000 | 312 | 0.00 | 0.27 |
| 0.002 | 46 | 0.08 | 0.19 |
| 0.005 | 18 | 0.13 | 0.16 |
| 0.020 | 5 | 0.21 | 0.22 |
| 0.100 | 1 | 0.38 | 0.38 |
- 1\(\alpha\)가 커질수록 학습 오차는 단조 증가하지만 교차검증 오차는 \(\alpha = 0.005\)에서 최소인 U자를 그리므로 이 지점을 선택해야 한다.
- 2학습 오차가 0인 \(\alpha = 0.000\)이 데이터를 가장 잘 설명하므로 최적이며, 교차검증 오차가 높은 것은 폴드를 나누는 과정에서 생긴 우연이다.
- 3학습 오차와 교차검증 오차의 차이가 가장 작은 \(\alpha = 0.100\)이 가장 잘 일반화된 모형이므로 이를 선택해야 한다.
- 4\(\alpha\)는 잎 노드의 개수만 조절할 뿐 예측 성능에는 영향을 주지 않으므로, 해석의 편의를 위해 잎이 5개인 \(\alpha = 0.020\)을 선택하는 것이 항상 바람직하다.
꿈라CBT