빅데이터분석기사 필기 · 9회 변형(엑셀) · 어려움 난이도 · 11번

Q.1120249어려움 변형빅데이터 분석 기획

다음 <보기>는 준지도 학습에서 널리 쓰이는 의사 라벨링(pseudo-labeling)의 진행 결과이다. 이에 대한 설명으로 가장 적절한 것은?

보기

라벨 2,000건으로 학습한 초기 모형으로 비라벨 데이터를 예측하고, 확신도가 높은 예측을 정답으로 간주해 학습 데이터에 추가하는 과정을 반복하였다.

회차추가된 의사 라벨학습 데이터 내 A 클래스 비율검증 정확도
1회8,000건52%0.83 (초기 0.79)
2회15,000건71%0.81
3회21,000건88%0.74
  • 1회차가 늘수록 학습 데이터가 커지므로 검증 정확도의 하락은 우연한 변동이며, 반복을 더 진행하면 반드시 회복된다.
  • 2A로 기운 예측이 다시 정답으로 투입되어 편향이 강화된 확증 편향이므로, 추가를 제한하고 클래스 비율과 임계값을 관리해야 한다.
  • 3검증 정확도가 떨어진 것은 의사 라벨의 양이 부족하기 때문이므로, 확신도 임계값을 낮추어 더 많은 예측을 정답으로 투입해야 한다.
  • 4의사 라벨링은 전문가가 확인한 라벨과 동일한 신뢰도를 가지므로, 클래스 비율 변화는 실제 분포를 반영한 자연스러운 결과로 보아야 한다.

정답: 2 · A로 기운 예측이 다시 정답으로 투입되어 편향이 강화된 확증 편향이므로, 추가를 제한하고 클래스 비율과 임계값을 관리해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기