다음 <보기>의 상황에 대한 진단과 대응으로 가장 적절한 것은?
보기
한 금융사가 머신러닝 기반 신용평가 모델을 도입하였다. 개발팀은 성별·국적·장애 여부 등 보호 속성을 학습 변수에서 모두 제외하였다.
그러나 운영 6개월 뒤 감사 결과, 특정 우편번호 구역(저소득층 밀집 지역) 거주 신청자의 승인율이 다른 구역의 절반 수준으로 나타났다. 조사해 보니
- 학습 데이터는 과거 10년간의 심사 이력이며, 당시에도 해당 구역의 거절률이 높았다.
- 우편번호는 소득 수준·주거 형태와 강하게 상관되어 있었다.
- 모델의 판별 성능(AUC)은 0.87로 우수하였다.
- 1보호 속성을 학습에서 제외하였으므로 모델은 공정하며, 관측된 승인율 격차는 데이터가 반영한 실제 신용 위험의 차이이므로 별도 조치가 필요하지 않다.
- 2우편번호가 보호 속성의 대리변수로 작동해 과거 편향이 재생산된 것이므로, 변수 제외만으로는 부족하고 대리변수 점검과 공정성 지표 측정이 필요하다.
- 3이는 거주지 정보가 노출된 사생활 침해 사례이므로, 우편번호 수집에 대한 별도 동의 절차를 강화하면 승인율 격차는 해소된다.
- 4판별 성능(AUC)이 0.87로 충분히 높다면 모델이 위험을 정확히 반영하고 있다는 뜻이므로, 성능을 더 끌어올리는 방향으로 개선하면 공정성 문제도 자연히 해결된다.
꿈라CBT