다음 <보기>의 결과에 대한 해석으로 가장 적절한 것은?
보기
이진 분류 데이터에서 변수 \(x_{1}, x_{2}\)와 목표변수 y의 관계가 다음과 같다. 네 조합이 각각 25%씩 나타난다.
| \(x_{1}\) | \(x_{2}\) | y | 비율 |
|---|---|---|---|
| 0 | 0 | 0 | 25% |
| 0 | 1 | 1 | 25% |
| 1 | 0 | 1 | 25% |
| 1 | 1 | 0 | 25% |
단변량 필터로 점검하니 \(x_{1}\)과 y의 상관계수도, \(x_{2}\)와 y의 상관계수도 모두 0이었다. 그러나 두 변수를 함께 사용하면 y를 100% 정확히 맞힐 수 있다.
- 1단변량 필터는 변수를 하나씩 평가해 조합에서만 드러나는 상호작용을 놓치므로, Wrapper·Embedded 기법을 검토해야 한다.
- 2두 변수 모두 y와 상관계수가 0이므로 예측에 아무런 정보를 주지 못하며, 100% 정확도가 나온 것은 과적합에 의한 착시이다.
- 3상관계수가 0인 것은 계산 오류이므로 스피어만 상관으로 다시 계산하면 두 변수 모두 1에 가까운 값이 나온다.
- 4\(x_{1}\)과 \(x_{2}\)의 상호 정보량을 각각 계산하면 0보다 크게 나오므로, 단변량 필터를 상호 정보량으로 바꾸기만 하면 이 문제는 해결된다.
꿈라CBT