빅데이터분석기사 필기 · 10회 변형(엑셀) · 어려움 난이도 · 51번

Q.51202510어려움 변형빅데이터 모델링

다음 <보기>의 상황에 대한 진단과 대응으로 가장 적절한 것은?

보기

센서 이상 탐지에 Gradient Boosting을 적용하였다. 데이터에는 라벨이 잘못 붙은 관측치가 약 5% 섞여 있는 것으로 파악되었다.

설정학습률트리 수학습 오차검증 오차
A0.31,0000.010.29
B0.051,0000.110.17
C0.051000.190.21

또한 설정 A에서 잘못 라벨링된 관측치들의 가중치가 반복 학습을 거치며 계속 커지는 현상이 확인되었다.

  • 1학습률이 클수록 각 트리가 오차를 크게 줄이므로 설정 A가 가장 우수하며, 잘못된 라벨에 가중치가 커지는 것은 모형이 어려운 사례를 학습하고 있다는 긍정적 신호이다.
  • 2부스팅은 이전 모델이 틀린 관측치에 집중해 잘못된 라벨까지 학습하므로, 학습률을 낮추고 트리 수를 조기 종료로 제어하며 배깅 계열이나 라벨 정제를 검토해야 한다.
  • 3부스팅은 각 트리를 독립적으로 학습하므로 잘못된 라벨의 영향이 평균으로 상쇄되며, 검증 오차 차이는 트리 수가 부족했기 때문이므로 설정 C의 트리 수를 10,000으로 늘려야 한다.
  • 4학습률과 트리 수는 서로 무관한 설정이므로 따로 조정하면 되고, 학습률을 0.05로 유지한 채 트리 수만 늘리면 검증 오차는 계속 감소한다.

정답: 2 · 부스팅은 이전 모델이 틀린 관측치에 집중해 잘못된 라벨까지 학습하므로, 학습률을 낮추고 트리 수를 조기 종료로 제어하며 배깅 계열이나 라벨 정제를 검토해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기