다음 <보기>의 결과에 대한 진단으로 가장 적절한 것은?
보기
고객 이탈을 예측하는 의사결정나무를 정보이득 기준으로 학습시켰다.
- 모델은 고객ID(모든 값이 서로 다름)를 최상위 분할 변수로 선택했다.
- 이 분할로 만들어진 자식 노드들은 엔트로피가 모두 0이었다.
- 학습 정확도는 100%였으나 검증 정확도는 무작위 수준이었다.
- 1정보이득은 범주가 많은 변수에 유리해 생긴 편향이므로, 이득비율을 쓰고 ID를 제외해야 한다.
- 2자식 노드의 엔트로피가 0이므로 완벽한 분할이며, 검증 정확도가 낮은 것은 검증 데이터의 오류이다.
- 3정보이득 대신 엔트로피 자체를 최대화하는 기준으로 바꾸면 이 문제가 해결된다.
- 4고객ID는 수치형 변수이므로 정규화를 적용하면 분할 변수로 선택되지 않는다.
꿈라CBT