다음 <보기>는 비식별 처리를 마친 진료 데이터의 일부이다. 이에 대한 평가와 보완 조치로 가장 적절한 것은?
보기
이름을 삭제하고 나이·우편번호를 범주화하여 동일한 준식별자 조합이 최소 5건씩 존재하도록 처리하였다.
| 동질집합 | 연령대 | 우편번호 | 건수 | 질병(민감 속성) |
|---|---|---|---|---|
| A | 30대 | 063** | 5건 | 5건 모두 '당뇨병' |
| B | 40대 | 063** | 6건 | 고혈압 3 / 당뇨병 2 / 천식 1 |
- 1k-익명성(k=5)은 만족하지만 A는 민감 속성이 모두 같아 속성 노출이 발생하므로, l-다양성과 t-근접성을 적용해야 한다.
- 2동질집합 A는 건수가 5건뿐이므로 k를 10 이상으로 높여 집합 크기만 키우면 속성 노출까지 함께 해결된다.
- 3이름이 삭제되었으므로 두 집합 모두 완전한 익명정보이며, 남은 위험은 없으므로 추가 조치는 필요하지 않다.
- 4동질집합 A의 문제는 우편번호가 충분히 가려지지 않은 데서 비롯되므로, 질병 항목에 데이터 마스킹을 적용하여 '당*병'으로 표기하면 해결된다.
꿈라CBT