빅데이터분석기사 필기 · 10회 변형(엑셀) · 어려움 난이도 · 79번

Q.79202510어려움 변형빅데이터 결과 해석

다음 <보기>는 한 분석가가 랜덤 포레스트 모형을 만든 과정이다. 이에 대한 설명으로 가장 적절한 것은?

보기
단계수행 내용
(가)학습을 시작하기 전에 트리 개수 500개, 최대 깊이 10으로 설정하였다.
(나)학습 결과 각 트리의 분할 변수와 분할 기준값이 정해졌다.
(다)검증 데이터의 성능을 보고 최대 깊이를 10 → 6으로 바꾸어 다시 학습하였다.
(라)테스트 데이터 성능이 기대에 못 미치자 최대 깊이를 6 → 4로 바꾸어 다시 학습한 뒤, 그때의 테스트 성능을 최종 일반화 성능으로 보고하였다.
  • 1(나)의 분할 기준값은 사람이 직접 입력하지 않은 값이므로 하이퍼파라미터에 해당하며, (라)는 성능이 개선되었으므로 바람직한 튜닝이다.
  • 2최대 깊이는 학습 과정에서 자동으로 조정되는 값이므로 (가)·(다)·(라)의 조정은 모두 불필요하며, 트리 개수만이 유일한 하이퍼파라미터이다.
  • 3(다)에서 검증 데이터의 성능을 보고 설정을 바꾼 것은 검증 데이터가 학습에 개입한 것이므로 데이터 누출에 해당하며, 하이퍼파라미터는 오직 사전 지식만으로 정해야 한다.
  • 4(가)·(다)의 값은 하이퍼파라미터, (나)는 학습으로 정해진 파라미터이며, (라)는 테스트 데이터를 튜닝에 써서 성능을 과대평가한 것이다.

정답: 4 · (가)·(다)의 값은 하이퍼파라미터, (나)는 학습으로 정해진 파라미터이며, (라)는 테스트 데이터를 튜닝에 써서 성능을 과대평가한 것이다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기