빅데이터분석기사 필기 · 10회 변형(엑셀) · 어려움 난이도 · 45번

Q.45202510어려움 변형빅데이터 모델링

다음 <보기>의 실험 결과에 대한 진단으로 가장 적절한 것은?

보기

관측치 800개, 변수 20개인 이진 분류 데이터에 SVM을 적용한 결과이다.

설정커널학습 정확도검증 정확도
A선형0.860.84
B\(RBF, \gamma\) 작음 · C 작음0.880.86
CRBF, \(\gamma\) 매우 큼 · C 매우 큼1.000.62
  • 1설정 C는 학습 정확도가 1.00으로 완벽하므로 가장 우수한 모형이며, 검증 정확도가 낮은 것은 검증 데이터에 이상치가 섞였기 때문이다.
  • 2설정 C는 \(\gamma\)와 C를 모두 크게 해 결정 경계가 복잡해진 과대적합이므로, 교차검증으로 두 값을 함께 탐색하고 지금은 검증 성능이 높은 B가 적절하다.
  • 3선형 커널인 A의 검증 정확도가 가장 낮으므로 이 데이터는 선형 분리가 전혀 불가능하며, 커널 차수를 계속 높이면 검증 성능도 함께 올라간다.
  • 4학습 정확도와 검증 정확도의 차이는 표본 수가 800개로 적기 때문이므로, 하이퍼파라미터는 그대로 두고 데이터를 8,000개로 늘리면 설정 C가 가장 좋은 성능을 낸다.

정답: 2 · 설정 C는 \(\gamma\)와 C를 모두 크게 해 결정 경계가 복잡해진 과대적합이므로, 교차검증으로 두 값을 함께 탐색하고 지금은 검증 성능이 높은 B가 적절하다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기