빅데이터분석기사 필기 · 10회 변형(엑셀) · 어려움 난이도 · 3번

Q.3202510어려움 변형빅데이터 분석 기획

다음 <보기>의 상황에 대한 진단과 대응으로 가장 적절한 것은?

보기

한 금융사가 머신러닝 기반 신용평가 모델을 도입하였다. 개발팀은 성별·국적·장애 여부 등 보호 속성을 학습 변수에서 모두 제외하였다.

그러나 운영 6개월 뒤 감사 결과, 특정 우편번호 구역(저소득층 밀집 지역) 거주 신청자의 승인율이 다른 구역의 절반 수준으로 나타났다. 조사해 보니

  • 학습 데이터는 과거 10년간의 심사 이력이며, 당시에도 해당 구역의 거절률이 높았다.
  • 우편번호는 소득 수준·주거 형태와 강하게 상관되어 있었다.
  • 모델의 판별 성능(AUC)은 0.87로 우수하였다.
  • 1보호 속성을 학습에서 제외하였으므로 모델은 공정하며, 관측된 승인율 격차는 데이터가 반영한 실제 신용 위험의 차이이므로 별도 조치가 필요하지 않다.
  • 2우편번호가 보호 속성의 대리변수로 작동해 과거 편향이 재생산된 것이므로, 변수 제외만으로는 부족하고 대리변수 점검과 공정성 지표 측정이 필요하다.
  • 3이는 거주지 정보가 노출된 사생활 침해 사례이므로, 우편번호 수집에 대한 별도 동의 절차를 강화하면 승인율 격차는 해소된다.
  • 4판별 성능(AUC)이 0.87로 충분히 높다면 모델이 위험을 정확히 반영하고 있다는 뜻이므로, 성능을 더 끌어올리는 방향으로 개선하면 공정성 문제도 자연히 해결된다.

정답: 2 · 우편번호가 보호 속성의 대리변수로 작동해 과거 편향이 재생산된 것이므로, 변수 제외만으로는 부족하고 대리변수 점검과 공정성 지표 측정이 필요하다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기