ADsP · 44회 변형(엑셀) · 어려움 난이도 · 24번

Q.24202544어려움 변형3과목 · 데이터 분석
다음은 k-NN 분류기를 적용하며 관찰한 현상 (가)~(라)이다. 이에 대한 해석으로 가장 적절한 것은?
보기

(가) k = 1로 두었더니 학습 데이터에 대한 정확도는 100%였으나, 검증 데이터에 대한 정확도는 크게 낮았다.
(나) k를 전체 데이터 개수와 같게 두었더니 모든 관측치가 하나의 같은 클래스로 분류되었다.
(다) 연 소득(원 단위)과 나이(세 단위)를 함께 사용했더니, 예측 결과가 사실상 소득만으로 결정되었다.
(라) 설명변수를 5개에서 200개로 늘렸더니 관측치 사이의 거리 차이가 줄어들면서 성능이 오히려 나빠졌다.

  • 1(가)는 과소적합, (나)는 과대적합의 사례로 k의 방향을 반대로 조정해야 한다.
  • 2(다)는 변수 간 척도 차이 때문이므로 표준화로 완화할 수 있고, (라)는 차원이 커질수록 거리의 변별력이 떨어지는 차원의 저주에 해당한다.
  • 3(나)는 k가 클수록 성능이 좋아진다는 것을 보여주므로, k는 가능한 한 크게 두는 것이 바람직하다.
  • 4(라)는 변수를 늘릴수록 정보량이 늘어나 성능이 좋아져야 하는 경우이므로, 관찰된 결과는 데이터 입력 오류 때문이다.

정답: 2 · (다)는 변수 간 척도 차이 때문이므로 표준화로 완화할 수 있고, (라)는 차원이 커질수록 거리의 변별력이 떨어지는 차원의 저주에 해당한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →ADsP 더 풀기