@BetaMoroney: 使用分割学习绕过隐私问题 https://forbes.com/sites/johnwerner/2026/07/24/getting-around-privacy…
摘要
福布斯文章解释了分割学习,这是一种使AI模型能够在敏感数据上训练而不暴露原始数据的技术,提高了隐私合规性并降低了通信成本。
查看缓存全文
缓存时间: 2026/07/24 15:13
借助拆分学习应对隐私难题
来源:https://www.forbes.com/sites/johnwerner/2026/07/24/getting-around-privacy-issues-with-split-learning/
传递接力棒
Getty
当今大型语言模型(LLM)的一些重大突破是由挑战驱动的,例如与隐私相关的挑战。如今,工程师们有办法应对AI中敏感数据的隐私问题。这种方法被称为“拆分学习”(Split Learning)。
在拆分学习的场景中,一个模型先在某个数据集上进行处理,然后将任务交给另一个LLM来完成。初始模型在所谓的“切割层”处完成工作,随后交棒。第二个模型接收输入并完成工作,同时无需接触那些需要保护的标识符和个人数据。
我在麻省理工学院媒体实验室(我的部分同事在此工作)找到了关于这一机制的解释,涉及前向传播和反向传播:
“切割层的输出被发送给另一个实体,该实体在不查看任何持有原始数据的客户端的原始数据的情况下,完成剩余的培训。这样就完成了一轮前向传播,而无需共享原始数据。随后,梯度从最后一层开始反向传播,直到切割层。切割层处的梯度(仅这些梯度)被发送回放射学客户中心。其余的反向传播现在在放射学客户中心完成。此过程持续进行,直到分布式拆分学习网络在互不查看对方原始数据的情况下完成训练。”
是不是有点难以理解?
拆分学习的好处
使用拆分学习可以降低通信成本,因为不需要将完整数据在整个工作流程中传输。但更重要的是,这种方法可以帮助AI系统遵守如HIPAA等隐私法规,并全面保护敏感数据资产。
Dong Nguyen Minh在Medium上的一份指南展示了这一点在医疗领域的应用:
“持有病理检测结果和放射学数据的两个实体,可以在不共享原始数据的情况下,协作训练用于患者诊断的深度学习模型,”Minh写道。“较小的医院可以为聚合模型(即通过整合来自不同来源的数据和知识来训练的ML模型,结合各模型优势以提升整体效果)贡献数据,而无需共享任何原始数据,从而更有效地服务有需要的人。”
Minh自己对这种方法的描述使用了“前端”和“后端”这两个术语:
“前端保留在本地设备上,它将输入数据处理到某个节点,通常是模型最后几个产生最终输出的层之前。前端的输出被发送到中央服务器,该服务器拥有模型的后端。服务器随后继续处理前端的输出,并生成最终输出。”
函数调用
这让我想起,作为计算机科学学生初次接触编程时所遇到的情形。复杂的代码库场景使用函数调用来传递需要以某种方式处理的数据。函数接收输入,返回输出,并将输出传递下去。新手学习这一过程,它成为他们编写代码的基础之一。
不过在这里,目标是分割工作流程以保护数据。
来自TEDxBoston的思考
最近,我采访了来自印度理工学院德里分校的Otkrist Gupta,他对这类技术有着丰富的企业经验。Gupta剖析了拆分学习的概念及其用途。
“你可以提示模型,”他说,“正如人们所见,它会为你泄露数据,泄露信用卡号码…… 想法是这样的:如果一开始就不共享数据会怎样?如果我们可以不共享数据就训练模型呢?所以我们想出一种方法,你不需要传输原始数据。你不需要传输本地保存的数据。你只传输神经网络的一种中间表示,然后这个中间表示继续学习,训练神经网络的其余部分。”
Gupta谈到了他在Lendbuzz的工作如何受到这一进展的影响,以及它如何使公司能够贷款给那些信用记录不佳、否则可能无法获得批准的人。
因此,拆分学习正在被融入商业。它是有效的。并且它确实部分回应了那些关于大数据所有权的问题。我们一直听到这样的讨论:当数据以光速在世界各地传输时,人们如何保护数据安全?深思熟虑似乎是关键。拆分学习将有助于实现这一点。
相似文章
@vicky_grok: 你的模型想要所有人的数据。法规说不行。这里有出路。6个数据孤岛。一个共享模型。零原始记录…
这条推文描述了联邦学习作为一种隐私保护方法,用于在数据孤岛间训练共享AI模型而无需移动原始数据,强调了合规性的架构决策,并提到使用Hoppscotch进行API测试。
深度学习中来自私有训练数据的半监督知识迁移
OpenAI 提出了 PATE(Private Aggregation of Teacher Ensembles),这是一种隐私保护方法,通过在多个教师模型的噪声输出上训练学生模型,这些教师模型在互不相交的数据集上进行训练,在不暴露敏感训练数据的情况下提供强大的差分隐私保证。
Split-LLM训练中的隐私漏洞:返回梯度使诱饵失效
本文探讨了split-LLM训练中的隐私失败问题,其中返回的梯度可以抵消诱饵机制并启用梯度反转攻击,从而破坏数据保护。
@RespanAI:介绍 Respan P-1,全球最佳隐私模型。每个AI应用都处理敏感数据。现有方法…
Respan 推出了 P-1,这是一种新的隐私模型,通过检测和编辑敏感信息,消除了准确性、延迟性和成本之间的权衡,树立了新的技术标杆。
推出前沿模型的零数据保留
OpenAI 为符合条件的 API 客户推出 Zero Data Retention,并预览 Private Safety Processing,以在不访问客户内容的情况下识别交互模式,在保护隐私的同时增强安全性。