다음 <보기>는 잡음이 섞인 데이터에 두 앙상블 기법을 적용한 결과이다. 이에 대한 해석으로 가장 적절한 것은?
보기
학습 데이터에는 라벨이 잘못 붙은 관측치가 약 8% 섞여 있다.
| 구분 | 단일 의사결정나무 | 랜덤포레스트 | 부스팅(반복 800회) |
|---|---|---|---|
| 학습 정확도 | 1.00 | 0.97 | 1.00 |
| 검증 정확도 | 0.72 | 0.88 | 0.79 |
| 비고 | — | — | 반복 300회 시점 검증 정확도 0.87 |
- 1랜덤포레스트는 평균으로 잘못된 라벨의 영향을 희석하지만, 부스팅은 잡음에 가중치를 계속 키워 800회에서 성능이 떨어지므로 조기 종료가 필요하다.
- 2부스팅은 반복 횟수가 많을수록 항상 성능이 좋아지므로, 800회에서 0.79가 나온 것은 반복이 아직 부족하기 때문이며 2,000회까지 늘려야 한다.
- 3학습 정확도가 1.00인 단일 나무와 부스팅은 같은 원리로 동작하므로 두 기법의 검증 성능도 같아야 하는데 다르므로, 실험 설정에 오류가 있다.
- 4배깅과 부스팅은 모두 분산을 줄이는 기법이므로 잡음이 있는 데이터에서는 성능이 동일하게 나타나야 하며, 표의 차이는 무작위 시드의 영향일 뿐이다.
꿈라CBT