다음 <보기>의 상황에 대한 판단으로 가장 적절한 것은?
보기
제품 불량 이미지 분류 모형의 정확도를 높이기 위해 두 팀이 각각 다른 방법을 시도하였다. 초기 정확도는 0.76이었다.
| 팀 | 수행 내용 | 결과 |
|---|---|---|
| 모델팀 | 알고리즘을 5종 비교하고 하이퍼파라미터를 대규모 탐색 | 0.76 → 0.79 |
| 데이터팀 | 검수 결과 라벨 불일치 12%를 발견해 판정 기준을 문서화하고 재라벨링 | 0.76 → 0.91 |
재라벨링 과정에서 같은 이미지를 검사자마다 다르게 판정하는 사례가 많았던 것으로 확인되었다.
- 1데이터팀의 개선 폭이 큰 것은 우연이므로, 정확도 향상의 정도와 무관하게 알고리즘 탐색을 계속 확대하는 것이 표준적인 접근이다.
- 2라벨 기준이 검사자마다 달라 정답이 흔들려 성능에 상한이 걸린 것이므로, 판정 기준을 명확히 해 라벨 일관성을 확보해야 한다.
- 3정확도 0.91은 지나치게 높은 값이므로 재라벨링 과정에서 검증 데이터의 정답까지 바꾸는 데이터 누수가 발생한 것이 분명하다.
- 4라벨 불일치 12%는 허용 범위이므로 데이터팀의 작업은 불필요했으며, 두 팀의 결과 차이는 평가 데이터가 서로 달랐기 때문이다.
꿈라CBT