아래는 어느 지방자치단체가 도입한 두 가지 데이터 기반 정책 (가), (나)이다. 이에 대한 설명으로 가장 적절하지 않은 것은?
보기
(가) 과거의 신고·처분 기록으로 학습한 모형이 산출한 '위반 위험 점수'가 높다는 이유만으로, 아직 아무런 위반 행위를 하지 않은 사업자에게 특별 점검 대상 지정과 월별 소명 자료 제출 의무를 부과하였다.
(나) 상권 진단 모형이 특정 지역의 폐업 위험을 실제보다 크게 추정하였는데, 그 원인은 매출 자료가 카드 결제 내역 중심으로만 수집되어 현금 거래 비중이 높은 소상공인의 매출이 대거 누락되었기 때문이었다. 지자체는 이 결과를 근거로 해당 지역의 지원 예산을 삭감하였다.
- 1(가)는 실제로 일어난 행위가 아니라 예측 결과만을 근거로 불이익을 부과한 것이므로 '책임 원칙 훼손'에 해당하며, 통제 방안은 실제 행위와 그 결과에 근거해서만 책임을 묻는 원칙을 지키는 것이다.
- 2(나)는 잘못된 데이터에 기반한 판단이 특정 집단에 불이익을 준 사례이므로 '데이터 오용'에 해당하며, 알고리즘의 판단 근거를 외부에서 검토할 수 있게 하는 접근 허용이 통제 방안이 된다.
- 3(가)와 (나)는 모두 개인 식별정보가 외부로 노출되어 발생한 문제이므로, 데이터의 익명화 수준을 높이면 두 사례 모두 근본적으로 해결될 수 있다.
- 4(나)처럼 수집 방식 자체가 특정 집단을 체계적으로 덜 포착하는 경우, 모형의 전체 예측 성능이 높게 나오더라도 그 집단에 대해서는 잘못된 결론이 반복될 수 있다.
꿈라CBT