빅데이터분석기사 필기 · 10회 변형(엑셀) · 어려움 난이도 · 34번

Q.34202510어려움 변형빅데이터 탐색

다음 <보기>의 분석 방식에 대한 지적으로 가장 적절한 것은?

보기

분석가는 이탈에 영향을 주는 요인을 찾기 위해 후보 변수 60개 각각에 대해 \(\alpha = 0.05\)로 개별 검정을 수행하였다.

  • 그 결과 4개 변수가 유의(p < 0.05)한 것으로 나타났다.
  • 4개 변수의 p-value는 0.011, 0.026, 0.038, 0.047이었다.
  • 분석가는 "이 4개 변수가 이탈의 원인"이라고 결론지었다.
  • 1유의한 변수가 4개나 나왔으므로 결론은 타당하며, 검정을 반복한 횟수는 각 검정의 독립성과 무관하므로 고려할 필요가 없다.
  • 260번 반복 검정에서는 효과가 없어도 우연히 유의해지는 변수가 평균 3개가량 나오므로, 본페로니 보정이나 FDR 통제를 적용해야 한다.
  • 3p-value가 0.05에 가까운 0.047은 신뢰할 수 없으므로 제외하고, 나머지 3개 변수만 원인으로 채택하면 다중검정 문제는 해소된다.
  • 4다중검정 문제를 피하려면 유의수준을 0.05에서 0.10으로 완화해 더 많은 변수를 채택한 뒤 그중에서 고르는 것이 바람직하다.

정답: 2 · 60번 반복 검정에서는 효과가 없어도 우연히 유의해지는 변수가 평균 3개가량 나오므로, 본페로니 보정이나 FDR 통제를 적용해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기