다음 <보기>는 준지도 학습에서 널리 쓰이는 의사 라벨링(pseudo-labeling)의 진행 결과이다. 이에 대한 설명으로 가장 적절한 것은?
보기
라벨 2,000건으로 학습한 초기 모형으로 비라벨 데이터를 예측하고, 확신도가 높은 예측을 정답으로 간주해 학습 데이터에 추가하는 과정을 반복하였다.
| 회차 | 추가된 의사 라벨 | 학습 데이터 내 A 클래스 비율 | 검증 정확도 |
|---|---|---|---|
| 1회 | 8,000건 | 52% | 0.83 (초기 0.79) |
| 2회 | 15,000건 | 71% | 0.81 |
| 3회 | 21,000건 | 88% | 0.74 |
- 1회차가 늘수록 학습 데이터가 커지므로 검증 정확도의 하락은 우연한 변동이며, 반복을 더 진행하면 반드시 회복된다.
- 2A로 기운 예측이 다시 정답으로 투입되어 편향이 강화된 확증 편향이므로, 추가를 제한하고 클래스 비율과 임계값을 관리해야 한다.
- 3검증 정확도가 떨어진 것은 의사 라벨의 양이 부족하기 때문이므로, 확신도 임계값을 낮추어 더 많은 예측을 정답으로 투입해야 한다.
- 4의사 라벨링은 전문가가 확인한 라벨과 동일한 신뢰도를 가지므로, 클래스 비율 변화는 실제 분포를 반영한 자연스러운 결과로 보아야 한다.
꿈라CBT