빅데이터분석기사 필기 · 11회 변형(엑셀) · 어려움 난이도 · 44번

Q.44202511어려움 변형빅데이터 모델링

다음 <보기>의 결과에 대한 진단으로 가장 적절한 것은?

보기

독립변수 후보 200개, 관측치 150개인 자료에 p-value 기준 단계적 선택법을 적용하였다.

  • 최종 모형에 12개 변수가 남았고 모두 p < 0.05였다.
  • 모형의 \(R^{2}\)은 0.85로 매우 높았다.
  • 그러나 새로 수집한 데이터에서는 거의 예측력이 없었다.
  • 112개 변수가 모두 유의하므로 모형은 타당하며, 새 데이터의 수집 방식에 문제가 있었을 것이다.
  • 2변수 수가 관측치 수보다 많으므로 후진제거법으로 바꾸면 이 문제가 해결된다.
  • 3\(R^{2}\)이 0.85로 높으므로 과적합이 아니며, 변수를 더 추가하면 예측력이 개선된다.
  • 4p-value로 반복 선별해 우연히 유의해진 변수가 뽑힌 것이므로, 교차검증이나 규제가 필요하다.

정답: 4 · p-value로 반복 선별해 우연히 유의해진 변수가 뽑힌 것이므로, 교차검증이나 규제가 필요하다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기