사전 목록
Training Data Extraction

학습데이터 추출 공격

학습데이터 추출 공격은 모델에 반복적이거나 조작된 질의를 보내 학습 과정에서 기억된 문장, 코드, 개인정보를 재생성하도록 유도하는 공격입니다.

#개인정보 공격#학습데이터 추출#생성형 AI#데이터 유출

학습데이터 추출 공격

중복되거나 희귀한 학습 표본, 과도한 모델 용량, 불충분한 필터링은 기억 가능성을 높입니다. 공격자는 출력 패턴을 탐색하고 후보를 검증해 원문에 가까운 내용을 얻으려 합니다.

핵심 정보

분류개인정보 공격

핵심 질문이 개념이 어떤 데이터·시스템·업무에 적용되며 실패할 때 누구에게 어떤 피해가 생기는지 확인합니다.

판단 원칙실제 구현, 권한, 데이터 흐름, 로그와 예외 절차를 함께 평가합니다.

공격이 진행되는 방식

생성형 모델과 자동완성, 임베딩·검색 결합 시스템에서 발생할 수 있습니다. 검색 증강 시스템에서는 학습데이터와 별도로 연결된 문서 접근권한 오류가 유출 원인이 됩니다.

운영 효과는 데이터 생성 지점, 처리 목적, 사용자와 관리자 권한, 외부 연동, 백업과 로그, 삭제 절차를 연결할 때 확보됩니다. 설계 문서와 실제 운영 상태가 다를 수 있으므로 설정값, 표본 데이터, 접근기록, 변경 이력을 근거로 검증합니다.

개인정보·시스템에 미치는 영향

이메일, 전화번호, 의료기록, 소스코드, 비밀키와 내부 문서가 출력될 수 있습니다. 일부 정보가 공개되면 다른 유출자료와 결합되어 개인을 식별할 수 있습니다.

개인정보 관련 위험에는 기밀성 침해, 잘못된 수정과 삭제, 서비스 중단, 부정확한 프로파일링, 차별적 의사결정, 계정 탈취, 사칭과 2차 피싱이 포함됩니다. 위험 평가는 정보의 민감도, 변경 가능성, 결합 가능성, 노출 기간, 대상 인원, 공격자의 실제 접근 능력을 반영합니다.

주요 징후와 조사 포인트

학습 데이터 중복과 민감정보, 카나리 문자열, 유사도 높은 출력, 반복 질의에 따른 원문 재현을 시험합니다. 모델 출력과 검색 원문의 출처를 구분해 조사합니다.

검토 결과에는 적용 범위, 남은 위험, 책임자, 개선 기한, 재검증 조건을 기록합니다. 외부 서비스와 오픈소스 구성요소가 관련되면 계약서와 보안 공지, 버전, 데이터 처리 위치, 하위 수탁·의존 관계도 확인합니다.

예방과 대응

보호조치는 예방, 탐지, 대응, 복구 단계에 나누어 배치합니다. 한 통제가 우회되거나 오작동해도 피해가 곧바로 전체 데이터로 확산되지 않도록 권한·네트워크·데이터·로그 통제를 겹쳐 적용합니다.

혼동하기 쉬운 개념

추출은 실제 내용의 재현을 목표로 하며 멤버십 추론은 특정 표본의 포함 여부를 추정합니다.

공식 참고자료

NIST AI 100-2e2025 — Adversarial Machine Learning

OWASP Top 10 for LLM Applications