다음 <보기>의 상황에 대한 진단과 대응으로 가장 적절한 것은?
보기
센서 이상 탐지에 Gradient Boosting을 적용하였다. 데이터에는 라벨이 잘못 붙은 관측치가 약 5% 섞여 있는 것으로 파악되었다.
| 설정 | 학습률 | 트리 수 | 학습 오차 | 검증 오차 |
|---|---|---|---|---|
| A | 0.3 | 1,000 | 0.01 | 0.29 |
| B | 0.05 | 1,000 | 0.11 | 0.17 |
| C | 0.05 | 100 | 0.19 | 0.21 |
또한 설정 A에서 잘못 라벨링된 관측치들의 가중치가 반복 학습을 거치며 계속 커지는 현상이 확인되었다.
- 1학습률이 클수록 각 트리가 오차를 크게 줄이므로 설정 A가 가장 우수하며, 잘못된 라벨에 가중치가 커지는 것은 모형이 어려운 사례를 학습하고 있다는 긍정적 신호이다.
- 2부스팅은 이전 모델이 틀린 관측치에 집중해 잘못된 라벨까지 학습하므로, 학습률을 낮추고 트리 수를 조기 종료로 제어하며 배깅 계열이나 라벨 정제를 검토해야 한다.
- 3부스팅은 각 트리를 독립적으로 학습하므로 잘못된 라벨의 영향이 평균으로 상쇄되며, 검증 오차 차이는 트리 수가 부족했기 때문이므로 설정 C의 트리 수를 10,000으로 늘려야 한다.
- 4학습률과 트리 수는 서로 무관한 설정이므로 따로 조정하면 되고, 학습률을 0.05로 유지한 채 트리 수만 늘리면 검증 오차는 계속 감소한다.
꿈라CBT