합성데이터
합성데이터는 실제 데이터의 통계적 특성과 구조를 모방해 인공적으로 생성한 데이터입니다.
합성데이터
규칙 기반 생성, 시뮬레이션, 통계모형, 생성형 모델을 사용할 수 있습니다. 실제 개인의 레코드를 직접 복사하지 않고 개발·테스트·분석에 필요한 패턴을 제공하는 것이 목적입니다.
핵심 정보
작동 원리
원본 데이터로 생성 모델을 학습할 때 과적합과 기억 위험을 평가하고 희귀 사례와 식별자를 제거합니다. 생성 후 유용성, 편향, 재식별, 멤버십 추론을 시험합니다.
운영 효과는 데이터 생성 지점, 처리 목적, 사용자와 관리자 권한, 외부 연동, 백업과 로그, 삭제 절차를 연결할 때 확보됩니다. 설계 문서와 실제 운영 상태가 다를 수 있으므로 설정값, 표본 데이터, 접근기록, 변경 이력을 근거로 검증합니다.
보호 효과와 한계
합성데이터가 실제 레코드를 지나치게 가깝게 복제하면 개인정보가 재현될 수 있습니다. 통계적 평균만 맞추면 희귀집단과 예외 시나리오가 사라져 테스트 품질과 공정성이 떨어질 수 있습니다.
개인정보 관련 위험에는 기밀성 침해, 잘못된 수정과 삭제, 서비스 중단, 부정확한 프로파일링, 차별적 의사결정, 계정 탈취, 사칭과 2차 피싱이 포함됩니다. 위험 평가는 정보의 민감도, 변경 가능성, 결합 가능성, 노출 기간, 대상 인원, 공격자의 실제 접근 능력을 반영합니다.
도입 전 확인할 사항
최근접 레코드 거리, 중복률, 멤버십 추론, 속성 추론, 분포·상관관계, 하위집단 정확도를 확인합니다. 생성 모델과 원본 접근권한, 삭제 계획도 검토합니다.
검토 결과에는 적용 범위, 남은 위험, 책임자, 개선 기한, 재검증 조건을 기록합니다. 외부 서비스와 오픈소스 구성요소가 관련되면 계약서와 보안 공지, 버전, 데이터 처리 위치, 하위 수탁·의존 관계도 확인합니다.
안전한 적용 방법
- 원본의 직접 식별자와 불필요한 희귀값을 먼저 제거합니다.
- 개인정보 공격 기반 평가와 통계적 유용성 평가를 함께 수행합니다.
- 생성 모델의 접근·배포를 데이터셋과 동일하게 관리합니다.
- 합성이라는 표시와 허용 용도, 한계를 사용자에게 알립니다.
보호조치는 예방, 탐지, 대응, 복구 단계에 나누어 배치합니다. 한 통제가 우회되거나 오작동해도 피해가 곧바로 전체 데이터로 확산되지 않도록 권한·네트워크·데이터·로그 통제를 겹쳐 적용합니다.
혼동하기 쉬운 개념
실제 개인 레코드를 기억하거나 가까운 표본을 생성하면 재식별 위험이 남습니다.