차분 프라이버시
차분 프라이버시는 한 개인의 데이터 포함 여부가 통계 결과에 미치는 영향을 제한하도록 무작위성을 추가하는 수학적 프라이버시 보장 방식입니다.
차분 프라이버시
질의 결과, 집계값, 모델 학습 과정에 조절된 노이즈를 더해 공격자가 특정 개인의 참여 여부나 값을 추론하기 어렵게 합니다. 프라이버시 예산은 반복 질의와 공개가 누적시키는 정보 노출을 관리합니다.
핵심 정보
작동 원리
민감도, epsilon·delta 같은 매개변수, 클리핑, 노이즈 분포, 질의 횟수와 사용자 단위를 정의합니다. 중앙형과 로컬형 적용 방식에 따라 신뢰 대상과 데이터 유용성이 달라집니다.
운영 효과는 데이터 생성 지점, 처리 목적, 사용자와 관리자 권한, 외부 연동, 백업과 로그, 삭제 절차를 연결할 때 확보됩니다. 설계 문서와 실제 운영 상태가 다를 수 있으므로 설정값, 표본 데이터, 접근기록, 변경 이력을 근거로 검증합니다.
보호 효과와 한계
노이즈가 너무 적으면 보호가 약하고 너무 많으면 결과가 쓸모없어집니다. 여러 결과를 반복 공개하면 예산이 소진되고 작은 집단 통계는 오차와 재식별 위험이 커질 수 있습니다.
개인정보 관련 위험에는 기밀성 침해, 잘못된 수정과 삭제, 서비스 중단, 부정확한 프로파일링, 차별적 의사결정, 계정 탈취, 사칭과 2차 피싱이 포함됩니다. 위험 평가는 정보의 민감도, 변경 가능성, 결합 가능성, 노출 기간, 대상 인원, 공격자의 실제 접근 능력을 반영합니다.
도입 전 확인할 사항
프라이버시 단위, 예산 회계, 반복 질의 제한, 작은 집단 처리, 정확도 검증을 확인합니다. 제품 문구가 수학적 보장 수준과 일치하는지도 검토합니다.
검토 결과에는 적용 범위, 남은 위험, 책임자, 개선 기한, 재검증 조건을 기록합니다. 외부 서비스와 오픈소스 구성요소가 관련되면 계약서와 보안 공지, 버전, 데이터 처리 위치, 하위 수탁·의존 관계도 확인합니다.
안전한 적용 방법
- 보호하려는 개인 단위와 공격자 지식을 명확히 정의합니다.
- 프라이버시 예산과 질의 횟수를 중앙에서 관리합니다.
- 작은 집단과 극단값에 대한 클리핑·최소 집단 기준을 적용합니다.
- 정확도와 공정성, 재식별 저항성을 함께 시험합니다.
보호조치는 예방, 탐지, 대응, 복구 단계에 나누어 배치합니다. 한 통제가 우회되거나 오작동해도 피해가 곧바로 전체 데이터로 확산되지 않도록 권한·네트워크·데이터·로그 통제를 겹쳐 적용합니다.
혼동하기 쉬운 개념
결과 공개에 따른 추론 위험을 확률적으로 제한하며 저장·전송 보호는 별도 통제가 필요합니다.