다음 <보기>의 결과에 대한 진단으로 가장 적절한 것은?
보기
같은 데이터에 두 앙상블을 적용하였다.
- 랜덤 포레스트: 검증 정확도 0.88
- AdaBoost: 학습 정확도 1.00, 검증 정확도 0.71
확인 결과 학습 데이터에는 라벨이 잘못 붙은 샘플이 약 5% 섞여 있었다.
- 1부스팅은 병렬 학습이므로 잘못된 라벨의 영향이 여러 모델에 분산되어 오히려 강건해야 한다.
- 2학습 정확도가 1.00이므로 AdaBoost가 데이터를 완벽히 이해한 것이며, 검증 정확도는 검증 세트의 난이도 때문이다.
- 3잘못된 라벨은 무작위 오류이므로 반복 횟수를 늘리면 자연히 상쇄되어 성능이 회복된다.
- 4AdaBoost가 잘못 라벨링된 샘플의 가중치를 키운 것이므로, 라벨 정제와 조기 종료를 검토해야 한다.
꿈라CBT