다음 <보기>는 비식별 조치를 마친 의료 데이터의 일부이다. 이에 대한 설명으로 가장 적절하지 않은 것은?
보기
준식별자는 연령대·성별·우편번호이며, 민감정보는 진단명이다. 아래 12개 레코드가 데이터 전부이다.
| 그룹 | 연령대 | 성별 | 우편번호 | 진단명(4건) |
|---|---|---|---|---|
| A | 30대 | 여 | 06*** | 감기, 감기, 감기, 감기 |
| B | 30대 | 남 | 06*** | 감기, 위염, 골절, 비염 |
| C | 40대 | 여 | 07*** | 폐암, 위암, 간암, 대장암 |
- 1이 데이터는 모든 동질 집단의 레코드 수가 4건이므로 4-익명성을 만족한다.
- 2그룹 A는 진단명이 한 가지뿐이므로 데이터 전체로는 2-다양성조차 만족하지 못하며, 동질성 공격에 노출된다.
- 3공격자가 '30대 여성이며 06 지역에 거주하는 지인'이 이 데이터에 포함되어 있다는 사실만 알아도, 그 지인의 진단명을 확정할 수 있다.
- 4그룹 C는 진단명이 4가지로 모두 다르므로 4-다양성을 만족하며, 따라서 t-근접성까지 추가로 적용할 필요는 없다.
꿈라CBT