차분 프라이버시
differential privacy
데이터에 일부러 통계적 잡음을 섞어 개인을 특정할 수 없게 하면서도 전체 경향은 파악할 수 있게 하는 프라이버시 보호 기법이다.
쉽게 말하면
차분 프라이버시란 데이터를 분석할 때 특정 개인의 정보가 드러나지 않도록 일부러 '노이즈'를 섞어 넣는 방법이다. 설문조사에서 민감한 질문에 답할 때 동전을 던져서 앞면이 나오면 사실대로, 뒷면이 나오면 무작위로 답하게 하면, 개별 응답만 봐서는 그 사람이 진짜로 뭐라고 답했는지 알 수 없지만 여러 명의 응답을 모으면 전체 경향은 여전히 계산해낼 수 있다. 차분 프라이버시는 이 아이디어를 수학적으로 정교하게 다듬은 것이다.
AI 모델을 학습시킬 때 이 기법을 쓰면, 학습에 사용된 데이터셋에 누군가 한 명의 정보가 포함되어 있는지 없는지를 나중에 모델의 답변만 보고는 구분하기 어렵게 만들 수 있다. 그래서 의료 기록이나 개인 대화처럼 민감한 데이터를 다뤄야 하는 연구에서, 개인정보를 지키면서도 유용한 인공지능 모델이나 가짜 데이터를 만들어내는 데 활용된다.
기사에서 이렇게 나와요
직접 해보기
챗봇에 이렇게 물어보면 개념이 더 와닿는다: '설문조사에서 동전 던지기로 응답을 무작위화해도 전체 통계는 정확하게 구할 수 있는 이유를 초등학생도 이해할 수 있게 설명해줘.' 이 답을 보면 차분 프라이버시가 개인의 답은 숨기면서 전체 경향은 지키는 원리를 감 잡을 수 있다.
