빅데이터분석기사 필기 · 11회 변형(엑셀) · 어려움 난이도 · 51번

Q.51202511어려움 변형빅데이터 모델링

다음 <보기>의 결과에 대한 진단으로 가장 적절한 것은?

보기

같은 데이터에 두 앙상블을 적용하였다.

  • 랜덤 포레스트: 검증 정확도 0.88
  • AdaBoost: 학습 정확도 1.00, 검증 정확도 0.71

확인 결과 학습 데이터에는 라벨이 잘못 붙은 샘플이 약 5% 섞여 있었다.

  • 1부스팅은 병렬 학습이므로 잘못된 라벨의 영향이 여러 모델에 분산되어 오히려 강건해야 한다.
  • 2학습 정확도가 1.00이므로 AdaBoost가 데이터를 완벽히 이해한 것이며, 검증 정확도는 검증 세트의 난이도 때문이다.
  • 3잘못된 라벨은 무작위 오류이므로 반복 횟수를 늘리면 자연히 상쇄되어 성능이 회복된다.
  • 4AdaBoost가 잘못 라벨링된 샘플의 가중치를 키운 것이므로, 라벨 정제와 조기 종료를 검토해야 한다.

정답: 4 · AdaBoost가 잘못 라벨링된 샘플의 가중치를 키운 것이므로, 라벨 정제와 조기 종료를 검토해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기