사전 목록
k-anonymity

k-익명성

k-익명성은 선택한 준식별자 조합이 데이터 안에서 최소 k명의 레코드에 동일하게 나타나도록 만드는 익명성 기준입니다.

#개인정보 보호 기술#k-익명성#익명화#준식별자

k-익명성

나이, 지역, 직업, 성별처럼 직접 식별자는 아니지만 결합 시 개인을 구분할 수 있는 속성을 일반화·억제합니다. k가 5라면 각 준식별자 조합이 최소 5개 레코드에서 같아야 합니다.

핵심 정보

분류개인정보 보호 기술

핵심 질문이 개념이 어떤 데이터·시스템·업무에 적용되며 실패할 때 누구에게 어떤 피해가 생기는지 확인합니다.

판단 원칙실제 구현, 권한, 데이터 흐름, 로그와 예외 절차를 함께 평가합니다.

작동 원리

연령을 구간으로 바꾸고 상세 주소를 시·도 수준으로 줄이며 희귀 조합을 제거하는 방식으로 적용합니다. 분석 목적에 필요한 정확도와 정보 손실을 함께 평가합니다.

운영 효과는 데이터 생성 지점, 처리 목적, 사용자와 관리자 권한, 외부 연동, 백업과 로그, 삭제 절차를 연결할 때 확보됩니다. 설계 문서와 실제 운영 상태가 다를 수 있으므로 설정값, 표본 데이터, 접근기록, 변경 이력을 근거로 검증합니다.

보호 효과와 한계

같은 집단의 민감속성이 모두 동일하면 개인을 특정하지 않아도 그 속성을 알아낼 수 있습니다. 공격자가 추가 배경지식을 갖고 있으면 k 조건을 만족해도 재식별 위험이 남습니다.

개인정보 관련 위험에는 기밀성 침해, 잘못된 수정과 삭제, 서비스 중단, 부정확한 프로파일링, 차별적 의사결정, 계정 탈취, 사칭과 2차 피싱이 포함됩니다. 위험 평가는 정보의 민감도, 변경 가능성, 결합 가능성, 노출 기간, 대상 인원, 공격자의 실제 접근 능력을 반영합니다.

도입 전 확인할 사항

준식별자 선정이 현실적인지, 최소 그룹 크기와 정보 손실, 민감속성 다양성, 외부 데이터 결합을 확인합니다. 평균 k만 보지 않고 가장 작은 집단과 삭제된 레코드를 분석합니다.

검토 결과에는 적용 범위, 남은 위험, 책임자, 개선 기한, 재검증 조건을 기록합니다. 외부 서비스와 오픈소스 구성요소가 관련되면 계약서와 보안 공지, 버전, 데이터 처리 위치, 하위 수탁·의존 관계도 확인합니다.

안전한 적용 방법

보호조치는 예방, 탐지, 대응, 복구 단계에 나누어 배치합니다. 한 통제가 우회되거나 오작동해도 피해가 곧바로 전체 데이터로 확산되지 않도록 권한·네트워크·데이터·로그 통제를 겹쳐 적용합니다.

혼동하기 쉬운 개념

k-익명성은 개인별 확률적 프라이버시 보장을 제공하지 않습니다. l-다양성차분 프라이버시는 서로 다른 약점을 보완하기 위해 제안된 별도 접근입니다.

공식 참고자료

NIST SP 800-188 — De-Identifying Government Datasets

ICO — Effective Anonymisation Guidance