빅데이터분석기사 필기 · 9회 변형(엑셀) · 어려움 난이도 · 55번

Q.5520249어려움 변형빅데이터 모델링

다음 <보기>는 잡음이 섞인 데이터에 두 앙상블 기법을 적용한 결과이다. 이에 대한 해석으로 가장 적절한 것은?

보기

학습 데이터에는 라벨이 잘못 붙은 관측치가 약 8% 섞여 있다.

구분단일 의사결정나무랜덤포레스트부스팅(반복 800회)
학습 정확도1.000.971.00
검증 정확도0.720.880.79
비고반복 300회 시점 검증 정확도 0.87
  • 1랜덤포레스트는 평균으로 잘못된 라벨의 영향을 희석하지만, 부스팅은 잡음에 가중치를 계속 키워 800회에서 성능이 떨어지므로 조기 종료가 필요하다.
  • 2부스팅은 반복 횟수가 많을수록 항상 성능이 좋아지므로, 800회에서 0.79가 나온 것은 반복이 아직 부족하기 때문이며 2,000회까지 늘려야 한다.
  • 3학습 정확도가 1.00인 단일 나무와 부스팅은 같은 원리로 동작하므로 두 기법의 검증 성능도 같아야 하는데 다르므로, 실험 설정에 오류가 있다.
  • 4배깅과 부스팅은 모두 분산을 줄이는 기법이므로 잡음이 있는 데이터에서는 성능이 동일하게 나타나야 하며, 표의 차이는 무작위 시드의 영향일 뿐이다.

정답: 1 · 랜덤포레스트는 평균으로 잘못된 라벨의 영향을 희석하지만, 부스팅은 잡음에 가중치를 계속 키워 800회에서 성능이 떨어지므로 조기 종료가 필요하다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기