다음 <보기>는 한 분석가가 랜덤 포레스트 모형을 만든 과정이다. 이에 대한 설명으로 가장 적절한 것은?
보기
| 단계 | 수행 내용 |
|---|---|
| (가) | 학습을 시작하기 전에 트리 개수 500개, 최대 깊이 10으로 설정하였다. |
| (나) | 학습 결과 각 트리의 분할 변수와 분할 기준값이 정해졌다. |
| (다) | 검증 데이터의 성능을 보고 최대 깊이를 10 → 6으로 바꾸어 다시 학습하였다. |
| (라) | 테스트 데이터 성능이 기대에 못 미치자 최대 깊이를 6 → 4로 바꾸어 다시 학습한 뒤, 그때의 테스트 성능을 최종 일반화 성능으로 보고하였다. |
- 1(나)의 분할 기준값은 사람이 직접 입력하지 않은 값이므로 하이퍼파라미터에 해당하며, (라)는 성능이 개선되었으므로 바람직한 튜닝이다.
- 2최대 깊이는 학습 과정에서 자동으로 조정되는 값이므로 (가)·(다)·(라)의 조정은 모두 불필요하며, 트리 개수만이 유일한 하이퍼파라미터이다.
- 3(다)에서 검증 데이터의 성능을 보고 설정을 바꾼 것은 검증 데이터가 학습에 개입한 것이므로 데이터 누출에 해당하며, 하이퍼파라미터는 오직 사전 지식만으로 정해야 한다.
- 4(가)·(다)의 값은 하이퍼파라미터, (나)는 학습으로 정해진 파라미터이며, (라)는 테스트 데이터를 튜닝에 써서 성능을 과대평가한 것이다.
꿈라CBT