Reed's News
← 返回精选

美国隐私危机:政治干预科学统计

Tech 66 flowercalled 2026/7/3 1858 字 原文 ↗

斯科特前言: 辛西娅·德沃克是哈佛大学戈登·麦凯计算机科学教授,也是差分隐私(differential privacy)与算法公平领域的先驱。我近期先后参加SigmaWest科学营和STOC(ACM计算理论研讨会)时,听到大量关于特朗普政府一项最新举措的讨论——该举措不仅要禁用差分隐私,实质上还将禁止所有用于大数据集隐私保护的现代技术,例如2030年美国人口普查计划采用的相关技术。我知道大家可能已"对愤怒感到麻木",但这一决定对计算机科学理论界而言,实在触碰到了核心利益。因此,当辛西娅在STOC上提议撰写一篇相关主题的客座文章时,我立刻应允。下文便是她与多位业内领袖联合署名的投稿。

2026年6月4日,美国商务部长发布指令(DAO 216-26),要求美国经济分析局(BEA)和人口普查局所有出版物的保密技术退回至20世纪70年代初的水平,彻底否定了半个多世纪以来在数据主体保护上的进步与成果。此前保密技术的发展,让人口普查局得以共享更大量、更精细的数据。而这项指令将导致统计数据实用性下降、可用数据减少,或两者兼而有之。我们撰写此文,旨在揭示该指令的危害,并呼吁科学界发声反对。

这项指令的背后是政治利益驱动,而非科学考量。DAO 216-26绕过了法定行政程序,兑现了美国传统基金会"2025计划"制定者的承诺,也反映了"美国复兴中心"(CRA)的主张与误解——该组织由美国管理与预算办公室主任拉塞尔·沃特创立。CRA针对2020年人口普查使用差分隐私的说明文章毫不掩饰其目的:"只要使用差分隐私,即便人口普查加入公民身份问题,也无法确定个人的身份状态。"但《人口普查法》(《美国法典》第13篇第9节[https://www.law.cornell.edu/uscode/text/13/9])明确要求对这类个人特征数据进行匿名处理,规定"发布任何可识别特定个体提交数据的内容均属犯罪"。此外,保密也是确保民众配合人口普查的关键,这已是广泛共识。

DAO-216-26禁用了差分隐私及其他现代(甚至部分非现代)技术,仅允许使用"粗化法"作为避披露技术,即"降低发布统计数据的细节或精度,例如通过取整、汇总(分组)和/或使用数值区间"。"抑制法"("明确删除特定数值")仅可作为"最后手段"使用。指令还禁止"噪声注入",即"通过添加随机值(噪声)修改数据集的方法"。

噪声注入技术的诞生,正是为了在遵守禁止发布可识别数据的保密法规前提下,满足对精细化数据日益增长的需求。粗化法和抑制法适用于多数全国性综合统计序列,如"联邦主要经济指标",但在处理细分地理区域或行业的商业及人口数据时完全失效。禁止噪声注入,意味着指令封杀了过去三十年来数十种数据发布方式的核心避披露技术:它禁用了自2002年起用于"季度劳动力指标"、原本计划用于经济分析局统计数据的输入噪声注入技术[1];禁用了自1990年起用于十年一度人口普查出版物的"数据置换法";还禁用了差分隐私——目前已知在给定隐私级别下能实现最高数据效用的方法。差分隐私自2008年起用于共享通勤模式数据(OnTheMap),并应用于2020年人口普查相关出版物,原本也计划用于2030年人口普查。此外,受影响的产品与流程还有很多

1. 案例说明

DAO-216-26与人口普查局"既要保障数据保密,又要确保数据可用"的双重使命相悖。为说明这一点,我们引用并拓展内森·戈德施拉格基于"县商业模式"(CBP)数据提出的案例。该数据按行业和地域划分,提供商业活动统计信息。戈德施拉格设计了三种场景,展示了提供有用信息与遵守《人口普查法》保护数据隐私之间的矛盾:

· "某小县仅有一家啤酒厂。若CBP发布该县啤酒厂员工的确切数量,就会泄露这家企业的员工规模信息,明显违反法律。 · "某小县有两家啤酒厂,若CBP发布该县啤酒厂员工的确切总数,其中一家企业的所有者就能推算出竞争对手的员工数量,同样违反法律。 · "某小县有两家以上啤酒厂,但CBP因担心泄露企业隐私,选择不发布啤酒厂员工总数。若有人计划在此地开办啤酒厂,因无法了解目标市场信息,可能会认为项目风险过高而放弃。"

在戈德施拉格的案例中,粗化法让发布的统计数据失去了实用价值。我们再补充第四个场景,说明粗化法甚至无法保障数据保密。为简化说明,假设我们都不拥有案例中的任何企业:该县有两个城镇,北本德和南本德,各有一家啤酒厂;北本德还有一家移动装瓶公司,南本德有一家固定装瓶公司,全县共有4家啤酒相关企业。其中北本德的啤酒厂和南本德的装瓶公司为公有企业。

CBP发布以下5项统计数据:

  • (A)北本德啤酒相关企业员工总数:因北本德仅有1家啤酒厂和1家装瓶公司,数据类别被粗化为"啤酒相关";
  • (B)南本德啤酒相关企业员工总数:因南本德仅有1家啤酒厂和1家装瓶公司,数据类别被粗化为"啤酒相关";
  • (C)全县啤酒酿造业员工总数:因北本德和南本德各有1家啤酒厂,统计范围被粗化为全县;
  • (D)全县瓶装酒业员工总数:因北本德和南本德各有1家装瓶公司,统计范围被粗化为全县;
  • (E)全县公有企业员工总数:因北本德和南本德各有1家公有企业,统计范围被粗化为全县。

此时我们得到4个未知数、5个方程,只需用其中4个(A、B、C、E),通过高中代数知识就能精确算出4家企业各自的员工数量。

在上述虚构但符合现实逻辑的场景中,CBP出于善意对地域、行业和企业所有权类别进行了粗化处理,但即便不掌握任何一家企业的内部信息,我们仍能完全还原所有数据。问题出在哪里?不同维度的粗化处理相互作用,反而留下了可被破解的漏洞。而噪声注入技术会干扰这些方程,防止数据被精确还原。

2. 实施障碍

美国商务部如今声称,指令回归70年代的传统统计技术("tradstat")对数据使用者有利:"我们对披露限制方法的更新,既能保护受访者,又能为公众提供更多重要经济信息。"(加粗为原文强调)但正如戈德施拉格的案例所示,粗化法的效果恰恰相反。

而且这一问题无法解决:粗化法的本质就是减少对精细化信息的获取。我们的案例显示,多重粗化处理相互作用,反而让保密机制失效——无需噪声注入,仅通过基础计算就能破解数据。对于人口普查而言,差分隐私等正规噪声注入技术正是为防范这类风险而设计的;戈德施拉格在其文章中提到的"复杂算法",正是用来保护公民身份等个人特征数据的关键。

3. 保密是联邦统计的核心

科学界仍在探讨保护受访者数据隐私的最佳技术,但DAO 216-26并非基于科学判断,而是政治利益驱动。发布该指令的人不惜以公众对统计过程的信任为代价,我们认为这一做法既错误又危险。

公职人员会尽力遵守指令,同时履行保护受访者数据隐私的法定义务。为平衡这两项相互冲突的要求,他们可能会选择减少数据发布量,或过度粗化数据使其失去实用价值;也可能在政治压力下发布易被破解的数据,就像上述啤酒厂案例那样。无论作何选择,他们都难以保证受访者的数据隐私,进而导致大量企业和个人拒绝配合调查——这对肩负"民主数据"使命的统计机构而言,无疑是毁灭性打击。

结论

我们需要的不是政治人士否决政府统计专家的专业判断,而是加大对国家统计机构的投入,确保这些机构拥有足够人力与资源,利用最先进的工具优化统计方法。无论科学界对某一特定隐私增强技术持何种态度,我们都必须共同抵制这种反科学的联邦统计管理方式——此事干系重大,不容有失。

行动指南

  1. 将本文分享给你的专业圈和社区成员。

  2. 联系你的国会众议员,表达你的担忧。致电或写信是选民最有效、最便捷的行动之一,仅需花费几分钟时间:

  • 点击此处查询你的议员联系方式;
  • 表达你的关切,可参考以下话术:"我是[姓名],来自你选区[城市],邮编[ZIP CODE]。我致电是为了表达对美国商务部长发布的DAO 216-26指令的担忧。该指令要求美国经济分析局和人口普查局的所有数据产品与统计数据,退回使用过时且无效的保密技术。若该指令生效,将摧毁国家赖以制定重要决策的公共数据——比如决定社区所需公共服务的选址。我要求撤销该指令,要求遵循正规行政程序,要求由联邦统计机构的专业人员来决定平衡数据效用与隐私的技术方法,而非由政治人士单方面拍板。"
  • 你还可主动说明自己的身份,如退休教师、在职专业人士等。
  1. 志愿参与人口普查工作文件与资料的保存工作。目前,解释"噪声注入"和"差分隐私"的页面已开始下线。请存档相关方法学页面和技术文档,你也可通过互联网档案馆的"时光机"(立即保存页面)完成存档。

约翰·阿布德 阿洛尼·科恩 辛西娅·德沃克 李在俊 贾什里·萨拉西 亚当·史密斯 萨利尔·瓦德汉

[1] 经济分析局工作论文WP2026-9,已被商务部删除。截至6月22日,谷歌搜索结果如下:

美国经济分析局(BEA)(.gov)https://bea.gov › files › papers › BEA-WP2026-9