빅데이터분석기사 필기 · 12회 변형(엑셀) · 어려움 난이도 · 16번

Q.16202612어려움 변형빅데이터 분석 기획

다음 <보기>의 결과에 대한 판단으로 가장 적절한 것은?

보기

이미지 분류 모델의 성능을 높이기 위해 학습 데이터를 100만 장에서 300만 장으로 늘렸으나, 검증 정확도는 오히려 91%에서 84%로 하락하였다.

추가한 200만 장은 웹 크롤링으로 수집해 자동 레이블링한 것이며, 표본 점검 결과 레이블 오류율이 약 18%로 확인되었다. 학습 데이터와 검증 데이터의 클래스 분포는 동일하게 유지되었다.

  • 1데이터가 많을수록 성능은 반드시 향상되므로, 학습 에폭(epoch)을 늘려 더 오래 학습시키면 해결된다.
  • 2검증 데이터의 수가 부족해 우연히 발생한 결과이므로, 검증 세트만 늘려 다시 측정하면 된다.
  • 3잘못된 레이블이 함께 늘어나 모델이 오류 패턴까지 학습한 것이므로, 데이터 양보다 레이블 품질 확보가 우선이다.
  • 4모델의 표현력이 부족해 생긴 과소적합이므로, 층과 파라미터 수를 늘리면 정확도가 회복된다.

정답: 3 · 잘못된 레이블이 함께 늘어나 모델이 오류 패턴까지 학습한 것이므로, 데이터 양보다 레이블 품질 확보가 우선이다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기