差分隐私
differential privacy
一种隐私保护技术,通过有意在数据中加入统计噪声,使个人无法被识别,同时仍能把握整体趋势。
简单来说
差分隐私是指在分析数据时,故意混入'噪声',从而让特定个人的信息无法被暴露出来的一种方法。比如做问卷调查时,对于敏感问题,让受访者先掷硬币:正面就如实回答,反面就随机回答。这样一来,光看单个人的回答,谁也猜不出这个人真实的答案是什么,但只要把大量人的回答汇总起来,仍然能够算出整体的趋势。差分隐私就是把这种思路用数学方法精确打磨后的产物。
在训练AI模型时应用这一技术,事后仅凭模型给出的答案,就很难判断训练数据集中是否包含了某个特定人的信息。因此,在需要处理病历、私人对话等敏感数据的研究中,差分隐私被用来在保护个人信息的同时,生成有用的AI模型或虚拟(合成)数据。
在报道中是这样出现的
文章提到,亚马逊资助的一项大学研究课题是'利用公开与非公开数据混合来生成差分隐私合成数据'。这里的差分隐私指的是一种在保护个人信息的同时生成可用于AI训练的虚拟数据的技术,与单纯的数据加密或匿名化是不同的概念。
亲手试一试
可以这样问聊天机器人:'请用小学生也能听懂的方式解释一下,为什么问卷调查中用掷硬币随机化答案,整体统计结果依然能算得准确。'看看它的回答,就能大致体会到差分隐私如何在隐藏个人答案的同时,仍能保留整体趋势。
