빅데이터분석기사 필기 · 10회 변형(엑셀) · 어려움 난이도 · 59번

Q.59202510어려움 변형빅데이터 모델링

다음 <보기>의 결과에 대한 해석으로 가장 적절한 것은?

보기

이진 분류 데이터에서 변수 \(x_{1}, x_{2}\)와 목표변수 y의 관계가 다음과 같다. 네 조합이 각각 25%씩 나타난다.

\(x_{1}\)\(x_{2}\)y비율
00025%
01125%
10125%
11025%

단변량 필터로 점검하니 \(x_{1}\)과 y의 상관계수도, \(x_{2}\)와 y의 상관계수도 모두 0이었다. 그러나 두 변수를 함께 사용하면 y를 100% 정확히 맞힐 수 있다.

  • 1단변량 필터는 변수를 하나씩 평가해 조합에서만 드러나는 상호작용을 놓치므로, Wrapper·Embedded 기법을 검토해야 한다.
  • 2두 변수 모두 y와 상관계수가 0이므로 예측에 아무런 정보를 주지 못하며, 100% 정확도가 나온 것은 과적합에 의한 착시이다.
  • 3상관계수가 0인 것은 계산 오류이므로 스피어만 상관으로 다시 계산하면 두 변수 모두 1에 가까운 값이 나온다.
  • 4\(x_{1}\)과 \(x_{2}\)의 상호 정보량을 각각 계산하면 0보다 크게 나오므로, 단변량 필터를 상호 정보량으로 바꾸기만 하면 이 문제는 해결된다.

정답: 1 · 단변량 필터는 변수를 하나씩 평가해 조합에서만 드러나는 상호작용을 놓치므로, Wrapper·Embedded 기법을 검토해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기