다음은 k-NN 분류기를 적용하며 관찰한 현상 (가)~(라)이다. 이에 대한 해석으로 가장 적절한 것은?
보기
(가) k = 1로 두었더니 학습 데이터에 대한 정확도는 100%였으나, 검증 데이터에 대한 정확도는 크게 낮았다.
(나) k를 전체 데이터 개수와 같게 두었더니 모든 관측치가 하나의 같은 클래스로 분류되었다.
(다) 연 소득(원 단위)과 나이(세 단위)를 함께 사용했더니, 예측 결과가 사실상 소득만으로 결정되었다.
(라) 설명변수를 5개에서 200개로 늘렸더니 관측치 사이의 거리 차이가 줄어들면서 성능이 오히려 나빠졌다.
- 1(가)는 과소적합, (나)는 과대적합의 사례로 k의 방향을 반대로 조정해야 한다.
- 2(다)는 변수 간 척도 차이 때문이므로 표준화로 완화할 수 있고, (라)는 차원이 커질수록 거리의 변별력이 떨어지는 차원의 저주에 해당한다.
- 3(나)는 k가 클수록 성능이 좋아진다는 것을 보여주므로, k는 가능한 한 크게 두는 것이 바람직하다.
- 4(라)는 변수를 늘릴수록 정보량이 늘어나 성능이 좋아져야 하는 경우이므로, 관찰된 결과는 데이터 입력 오류 때문이다.
꿈라CBT