연합학습
연합학습은 원본 데이터를 중앙에 모으지 않고 여러 기기나 기관에서 모델을 학습한 뒤 업데이트를 결합하는 머신러닝 방식입니다.
연합학습
각 참여자는 로컬 데이터로 모델 업데이트를 계산하고 중앙 조정자 또는 분산 프로토콜이 이를 집계합니다. 데이터 이동을 줄일 수 있으나 업데이트 자체에 원본 정보가 반영될 수 있습니다.
핵심 정보
작동 원리
보안 집계, 차분 프라이버시, 클리핑, 참여자 인증, 업데이트 검증을 조합합니다. 수평·수직 연합학습과 기기형·기관형 구조에 따라 공격면과 신뢰 가정이 달라집니다.
운영 효과는 데이터 생성 지점, 처리 목적, 사용자와 관리자 권한, 외부 연동, 백업과 로그, 삭제 절차를 연결할 때 확보됩니다. 설계 문서와 실제 운영 상태가 다를 수 있으므로 설정값, 표본 데이터, 접근기록, 변경 이력을 근거로 검증합니다.
보호 효과와 한계
악성 참여자가 모델을 오염시키거나 업데이트를 분석해 개인 데이터를 추론할 수 있습니다. 중앙 서버와 통신 채널, 학습 라이브러리 침해도 개인정보 유출과 모델 변조로 이어집니다.
개인정보 관련 위험에는 기밀성 침해, 잘못된 수정과 삭제, 서비스 중단, 부정확한 프로파일링, 차별적 의사결정, 계정 탈취, 사칭과 2차 피싱이 포함됩니다. 위험 평가는 정보의 민감도, 변경 가능성, 결합 가능성, 노출 기간, 대상 인원, 공격자의 실제 접근 능력을 반영합니다.
도입 전 확인할 사항
업데이트 가시성, 참여자 신뢰, 드롭아웃 처리, 보안 집계, 추론 공격, 데이터 편향을 확인합니다. 원본이 이동하지 않는다는 문구만으로 보호 수준을 판단하지 않습니다.
검토 결과에는 적용 범위, 남은 위험, 책임자, 개선 기한, 재검증 조건을 기록합니다. 외부 서비스와 오픈소스 구성요소가 관련되면 계약서와 보안 공지, 버전, 데이터 처리 위치, 하위 수탁·의존 관계도 확인합니다.
안전한 적용 방법
- 모델 업데이트에 보안 집계와 전송 보호를 적용합니다.
- 차분 프라이버시와 클리핑으로 개별 기여 노출을 제한합니다.
- 악성·이상 업데이트를 탐지하고 참여자를 인증합니다.
- 학습 로그와 모델 배포, 재학습 절차를 접근통제합니다.
보호조치는 예방, 탐지, 대응, 복구 단계에 나누어 배치합니다. 한 통제가 우회되거나 오작동해도 피해가 곧바로 전체 데이터로 확산되지 않도록 권한·네트워크·데이터·로그 통제를 겹쳐 적용합니다.
혼동하기 쉬운 개념
연합학습은 분산학습의 한 형태이며 원본 중앙수집을 줄이는 장점이 있습니다. 업데이트와 최종 모델에서 정보가 새어 나올 수 있어 별도 보호기술이 필요합니다.