禁止噪声注入将对统计数据产品造成灾难
摘要
美国商务部已下令禁止在 Census Bureau 和 Bureau of Economic Analysis 的所有统计产品中注入噪声,这可能会削弱差分隐私保护和统计准确性。
<p><a href="https://lobste.rs/s/jcpzqt/banning_noise_will_be_disaster_for">评论</a></p>
查看缓存全文
缓存时间: 2026/06/13 17:06
# 禁止噪声将对统计数据产品造成灾难 — Ted的写作笔记
来源:https://desfontain.es/blog/banning-noise.html
**上周**,美国商务部发布了一项命令(https://www.commerce.gov/opog/disclosure-avoidance-statistical-products),宣布在人口普查局和经济分析局发布的所有统计产品中,禁止使用“噪声注入”。
文章中提到的那份命令截图内容如下:
a. 部门的首要目标是履行其统计职责,向公众提供准确、客观的信息。
b. 部门坚定致力于为每项统计产品在准确性、保密性、客观性和相关性之间取得平衡,以符合其统计职责和适用的法律要求。
c. 任何使用噪声注入的做法均与部门政策不符。
02 人口普查局和经济分析局在考虑和应用披露规避方法时,应遵循以下优先级顺序:
a. 粗化应成为所有统计产品的首选披露规避方法类别。
b. 只有在法律禁止粗化或粗化会严重损害统计产品的准确性或可用性时,才允许将抑制作为最后手段使用。
c. 不得在任何统计产品中使用噪声注入。(https://www.commerce.gov/opog/disclosure-avoidance-statistical-products)
这到底意味着什么?为什么你应该关注?
## 背景
统计产品是从一个秘密数据集中发布的一系列数字。通常,这些数据集包含机密信息,因此必须确保这些数字不会泄露这些信息。美国人口普查(https://en.wikipedia.org/wiki/United_States_census)就是一个众所周知的例子:统计数据公开,但每位美国居民填写的每一份表格内容必须保密。
科学家们已经开发了许多技术,用于在保护原始数据隐私的同时发布有用的统计数据。在统计界,这一领域被称为*披露规避*。以下是其中一些技术:
- *抑制*:删除未通过某些阈值的数据(例如,如果某个人数低于5,则不发布)。
- *粗化*(或*泛化*):使数据属性不那么精确(例如,将县转换为州,将出生日期转换为年龄范围等)。
- *抽样*:从数据集中随机删除一些记录。
- *交换*:从不同记录中提取属性并随机交换。
- *贡献边界控制*:确保单个个体无法通过对统计数据的“过度”贡献来影响结果,从而限制其最大影响。
- *噪声添加*:向统计数据添加随机数,以隐藏其真实值。
其中一些技术结合起来,可以达到一种称为差分隐私(https://desfontain.es/blog/friendly-intro-to-differential-privacy.html)的定义。这个定义具有许多很好的基本属性(https://desfontain.es/blog/differential-privacy-awesomeness.html),并被广泛认为是科学家心目中的隐私保护黄金标准。为了实现这一点,科学家通常依赖贡献边界控制和经过精心校准的噪声添加的组合。
从1990年到2010年,美国人口普查局在十年一次的人口普查中主要依赖交换技术。后来,他们意识到这种技术实际上非常不安全(https://desfontain.es/blog/us-census-reconstruction-attack.html),并且通过发布的统计数据很容易重建个人记录。这很糟糕,因为联邦法律要求该局对这些记录保密。因此,他们尝试了几种替代方法,并决定在2020年人口普查中采用差分隐私:这是既能保持统计数据最有用,又能防止这些攻击的方法。
必须重申:选择差分隐私并不是因为其数学原理很优美或令人信服¹(https://desfontain.es/blog/banning-noise.html#fn:math)。而是在所有能够缓解攻击的选项中,它能最大限度地保留实用性。其精确的隐私参数并非因为能够提供坚如磐石的可证明保证,而是因为在达到可接受的隐私保护水平的同时,它能从数据中榨取最多的可用性。
遗憾的是,“在新发现的隐私约束下保持了最大的实用性”并不意味着“保持了与2010年人口普查相同的实用性”:数字变得更不准确,而且这些不准确性变得更加透明,因此无法忽视。这让很多人非常愤怒。
- 人口学家和社会科学家再也无法忽视他们正在处理的是带噪声的数据。这需要他们在概念化和处理这些数据的方式上发生重大转变(https://hdsr.mitpress.mit.edu/pub/3vj5j6i0/release/3)。
- 那些利用人口普查数据实际重建记录的人再也无法这样做。人口学家承认这是常见做法(https://desfontain.es/blog/five-stages.html#demographer-quote)。政治操作者将其作为选区划分(https://en.wikipedia.org/wiki/Gerrymandering)的一部分,这也是一个公开的秘密。
呼,背景信息够多了。
## 命令说了什么?
行政部门现在决定,噪声注入不再是一种可接受的披露规避技术。
该命令明确针对差分隐私,但似乎也影响了其他涉及随机性的技术:文本中明确提到粗化应始终优先,抑制作为“最后手段”才可使用。我不知道命令为什么如此具体。也许他们是想确保在人口普查局工作的科学家不能在不称之为差分隐私的情况下仍使用类似的技术?
命令还谨慎地表示,“不得解释为与任何宪法、法律、法规或其他法律规定相冲突”。因此,这些统计产品的保密义务仍然适用。
## 实践中会有什么影响?
后果将对实用性或隐私造成严重影响,甚至两者兼有。这一点怎么说都不为过:未来的统计发布要么与过去相比毫无用处,要么将极其不安全。
首先,从披露规避工具箱中拿掉有用的工具,总会导致在隐私/实用性权衡上更加痛苦。这个研究领域的全部意义就在于更好地理解和量化隐私风险,并开发更好的工具来在保持实用性的同时减轻这些风险。
对于统计发布而言,差分隐私只是我们现在拥有的最佳工具。它提供了一种更精细的方式来量化权衡,并允许我们在相似隐私水平下获得比竞争技术更多的实用性。如果你把它拿走,剩下的技术要么在相同隐私水平下实用性更差,要么在相同实用性下隐私更差。
但所有竞争技术*也*依赖于噪声添加。其他统计机构使用的单元格密钥方法(https://sdctools.github.io/HandbookSDC/05-frequency-tables.html#sec-CKM_freq)向统计数据添加噪声。1990年至2010年用于美国人口普查的交换技术也向过程中注入了随机性。抽样在统计工作中无处不在²(https://desfontain.es/blog/banning-noise.html#fn:sampling)。甚至插补(https://en.wikipedia.org/wiki/Imputation_(statistics))严格来说也会向数据中添加噪声³(https://desfontain.es/blog/banning-noise.html#fn:imputation)!
相比之下,粗化和抑制是非常粗糙的工具。它们只适用于统计数据已经非常粗略且发布数量不多的情况。对于包含许多关于小群体(如美国人口普查)的统计数据的复杂数据产品而言,它们要么摧毁所有数据实用性(尤其对少数群体而言),要么极易遭受隐私攻击。
这很合理:针对统计发布的隐私攻击是关于解一组方程(https://desfontain.es/blog/attacks-on-statistics.html)。当你确切知道统计数据全部准确无误时,这项任务*简直*太容易了。噪声迫使你计算概率、量化不确定性、仔细考虑基线等等。这就是为什么随机性是披露规避如此有用的工具!即使没有正式保证,它也能使攻击变得困难得多。把它拿走,攻击就会变得微不足道。
## 为什么会这样?
我的意思是,谁知道呢。
也许目标是迫使美国人口普查发布实际上能够实现重新识别的统计数据,以帮助未来的选区划分工作?或者恰恰相反,也许是想法是停止发布有用的人口统计数据,以防止研究人员展示人口中的不公平差异?
汉隆剃刀(https://en.wikipedia.org/wiki/Hanlon%27s_razor)提供了另一种解释。统计数据发布内在的隐私/实用性权衡是*令人恼火的*。如果发布大量统计数据不会自动带来高隐私风险,那会容易得多。差分隐私使这种权衡明确化,从而变得不可忽视。也许禁止它是一种假装问题不存在的方法,希望问题会自行消失?
---
感谢 Adam Sealfon、Aloni Cohen、Ben Jacobsen 和 Gautam Kamath 对本文早期草稿提出的有益意见。
相似文章
ICE 想知道过去两年内从REI购买特定绿色无檐小便帽的所有人
ICE正在使用传票以识别在明尼阿波利斯地区从REI购买特定绿色无檐小便帽的个人,作为对抗议者调查的一部分,引发了对隐私和政府过度干预的担忧。
这家NAS公司想要接管你的本地智能家居
Ugreen推出了其HomeAgent智能家居平台,具有本地AI处理和存储功能,以增强隐私保护并消除订阅费用。
跨合成数据生成器家族的可移植因果公平性
这篇论文展示了因果公平机制,特别是因果图上的边切割,能够跨各种合成数据生成器家族移植,包括GANs和扩散模型,对数据保真度和实用性影响极小。
从欧几里得到图结构数据:协作学习综述
本综述对从欧几里得数据到图结构数据的协作学习进行了全面研究,旨在整合这一新兴领域并识别开放性挑战。
美国参议员呼吁NSA就VPN使用提供指导
一名美国参议员要求NSA就使用虚拟专用网络(VPN)保护通信免受外国威胁的最佳实践提供公开指导,指出当前建议中存在的不足。