新方法旨在保护儿童免受非法AI生成内容的侵害

MIT News — Artificial Intelligence 论文

摘要

MIT研究人员开发了一种技术,用于审计AI模型生成儿童性虐待材料的能力,而无需产生非法输出,在测试中达到了100%的准确率。该方法通过检查模型的隐藏表征来推断模型是否已被微调用于有害内容,为平台和执法部门提供了一种可扩展的检测不安全模型的方法。

<p>随着生成式人工智能的迅速普及,现在网上有许多开源模型可供任何人根据其任务进行调整,例如生成特定艺术风格的产品效果图。&nbsp;</p><p>但这些模型也会落入恶意行为者手中,他们可能会优化这些模型以生成非法内容,如仇恨言论或儿童性虐待材料(CSAM)。这是一个日益严重的问题——国家失踪与被剥削儿童中心&nbsp;<a href="https://www.missingkids.org/theissues/generative-ai" target="_blank">在2025年收到了超过150万份</a>关于AI生成的CSAM的报告,较2024年的6.7万份有所增加。</p><p>工程师通常通过提示模型并检查其输出来测试AI的有害能力,但对于CSAM来说这是不可能的,因为在美国,无论意图如何,生成此类内容都是非法的。</p><p>为了避免这一困境并提高AI安全性,由研究生Vinith Suriyakumar和副教授Ashia Wilson、Marzyeh Ghassemi领导的MIT科学家团队,与<a href="https://www.thorn.org/" target="_blank">Thorn</a>的研究人员合作,开发了一种新的审计方法,无需提示模型即可确定模型是否能够生成CSAM。Thorn是一个儿童安全非营利组织,其使命是改变在数字时代保护儿童免受性虐待和剥削的方式。</p><p>他们的技术检查模型内部工作方式的调整情况,但从不生成输出。通过检查隐藏表征,它可以可靠地推断模型是否已被专门用于生成有害图像。</p><p>在测试中,该审计程序以100%的准确率识别出专门用于生成CSAM的模型变体。托管平台可以使用此技术标记不安全的模型,并迅速删除它们,或者从一开始就阻止其上传。</p><p>“这为托管开源模型的平台和执法部门开辟了一条新途径,可以实际测试模型是否能够生成CSAM。以前,我们无法衡量这一点。这是一个巨大的盲点,有些人一直在利用它。现在,我们可以解决一个产生严重负面影响的AI安全问题,”MIT电气工程与计算机科学(EECS)研究生、该论文的第一作者Vinith Suriyakumar说。</p><p>Suriyakamur和Wilson——EECS的Lister Borthers职业发展教授、信息与决策系统实验室(LIDS)的首席研究员——与MIT博士后Lena Stempfle、EECS副教授兼医学工程科学研究所(IMES)和LIDS成员的Ghassemi,以及波士顿大学和Thorn的其他人员共同参与了该论文。该论文将在国际机器学习大会的“可信赖AI向善”研讨会上作为亮点展示。</p><p><strong>审计调整</strong></p><p>最近的技术使用户更容易通过称为微调的过程来专门化生成式AI模型以完成其任务。&nbsp;</p><p>无需在特定任务数据集上重新训练整个模型,个人可以利用一种称为低秩适应(LoRA)的算法以更高效的方式专门化模型。</p><p>这引发了一波新的用于各种目的的生成式AI模型变体,例如生成模仿艺术运动的水彩图像。但这也使恶意行为者能够创建生成高质量CSAM和其他有害图像的模型。</p><p>为了审计模型,工程师通常提示模型生成有害内容并检查其输出,但这种手动审计程序不可扩展。此外,反复生成令人发指的图像可能会对人类评估者产生负面心理影响。&nbsp;</p><p>这种评估方法在测试CSAM时很快失效,因为在美国和许多其他国际司法管辖区,为任何目的生成CSAM都是非法的。</p><p>“我们处于非常困难的境地,根据法律本身,我们不能使用事实上的评估手段。我们不得不抛弃整个工具包,采取不同的方法,”Suriyakumar说。</p><p>在了解到这一难题后,研究人员与Thorn联手解决这个问题。</p><p><strong>一种非生成式解决方案</strong></p><p>研究人员没有关注输出,而是针对LoRA算法在微调过程中所做的修改。&nbsp;</p><p>他们的技术探测这些称为LoRA适配器的修改,以确定模型是否已被专门用于有害能力,而无需生成输出。</p><p>使用一种称为高斯探测的技术,研究人员向模型输入一组随机数据点,并分析模型在其多层内部结构中如何操纵这些数据。&nbsp;</p><p>“我们从不将模型运行到底或提示模型,因此我们从不生成图像,”Suriyakumar解释说。</p><p>研究人员在模型内部结构中的多个时间点捕获这些修改,并对它们进行平均,以总结LoRA适配器如何改变模型的计算。他们发现这些响应是模型如何被专门化的强烈信号。</p><p>他们在三种类型的模型变体上测试了他们的方法,将结果与已知用于生成CSAM、其他有害图像和安全内容的LoRA适配器的真实数据进行比较。&nbsp;</p><p>他们的方法在识别已被调整以生成CSAM的模型方面达到了100%的准确率。&nbsp;</p><p>“AI带来了大量儿童安全问题,这些都是需要解决的真实问题。许多儿童正受到AI深度伪造的伤害。我们已经表明高斯探测可以成为一个非常有用的工具,我们希望研究界真正更多地关注这个问题,”Wilson说。</p><p>重要的是,他们的技术具有可扩展性,实施成本相对较低。由于每月有成千上万个模型变体在线发布,可扩展性是帮助审计人员在有害调整广泛传播之前将其删除的关键。</p><p>高斯探测也比其他一些审计技术更稳健,因为恶意行为者需要仔细改变基础模型的内部工作方式以避免被检测到。</p><p>未来,研究人员希望在更大的模型变体集上评估他们的技术,并探索高斯探测是否可以在基础模型被调整之前检测到有害能力。</p><p>“现在我们有了一个技术方法来部分解决这个问题。这次合作投入了大量精力,使我们能够解决一个真正困难的问题,这个问题正在伤害全国乃至全世界的许多儿童。希望我们能够在这个领域产生变革性的影响,”Ghassemi说。</p><p>这项工作部分得到了Bridgewater AIA Labs研究奖学金的支持。</p>
查看原文
查看缓存全文

缓存时间: 2026/07/13 10:49

# 新方法旨在保护儿童免受非法AI生成内容的侵害 来源:https://news.mit.edu/2026/new-method-keeps-kids-safe-from-illegal-ai-generated-content-0713 随着生成式人工智能的爆炸式流行,许多开源模型如今可在网上供任何人针对自己的任务进行适配,例如生成特定艺术风格的产品渲染图。 但这些模型也可能落入不法分子之手,他们可能会优化这些模型以生成非法内容,比如仇恨言论或儿童性虐待材料(CSAM)。这是一个日益严重的问题——全国失踪与受虐儿童中心在2025年收到了超过150万份关于AI生成CSAM的报告,而2024年这一数字为6.7万。 工程师们通常通过向模型输入提示词并检查其输出来测试AI的有害能力,但这对CSAM来说是不可能的,因为在美国,无论意图如何,生成此类内容都是非法的。 为了避免这一困境并提升AI安全性,由研究生Vinith Suriyakumar以及副教授Ashia Wilson和Marzyeh Ghassemi领导的麻省理工学院科学家团队,与Thorn的研究人员合作,开发了一种新的审计方法,可以在不输入提示词的情况下判断模型是否能生成CSAM。Thorn是一家致力于在数字时代转变儿童免受性虐待和剥削保护方式的无儿童安全非营利组织。 他们的技术检查模型内部工作机制是如何被适配的,但从不生成输出。通过检查隐藏表示,它可以可靠地推断模型是否已被专门化以生成有害图像。 测试时,该审计程序以100%的准确率识别出经过专门化以生成CSAM的模型变体。托管平台可以使用这种技术标记不安全的模型,并快速移除它们,或者从一开始就阻止它们被上传。 “这为托管开源模型的平台以及执法部门实际测试模型是否能生成CSAM开辟了一条新途径。以前,我们没有办法衡量这一点。这是一个巨大的盲点,一些人正在利用它。现在,我们可以解决一个对现实造成严重负面影响的AI安全问题,”MIT电气工程与计算机科学(EECS)研究生、关于这项技术的论文第一作者Vinith Suriyakumar表示。 Suriyakumar 和 Wilson(Lister Brothers职业发展教授、信息与决策系统实验室(LIDS)首席研究员)与论文的其他作者包括MIT博士后Lena Stempfle;EECS副教授、医学工程科学研究所(IMES)和LIDS成员Ghassemi;以及波士顿大学和Thorn的其他研究人员。该论文将在国际机器学习大会的“可信AI造福”研讨会上作为亮点展示。 **审计改编** 最近的技术使用户能够通过一种称为微调的过程,更轻松地针对自己的任务专门化生成式AI模型。 用户无需在整个模型上重新训练特定任务的数据集,而是可以利用一种称为低秩适配(LoRA)的算法,以更高效的方式专门化模型。 这引发了一波新的生成式AI模型变体浪潮,用于各种目的,例如生成模仿艺术运动的水彩画图像。但这也让恶意行为者能够创建可生成高质量CSAM和其他有害图像的模型。 为了审计模型,工程师通常会提示模型生成有害内容并检查其输出,但这种手动审计过程不可扩展。此外,反复生成骇人图像可能对人类评估者产生负面心理影响。 这种评估方法在测试CSAM时很快失效,因为在美国和许多其他国际司法管辖区内,无论出于何种目的生成CSAM都是非法的。 “我们处于一个非常困难的境地,根据法律本身,我们不能使用事实上的评估手段。我们不得不抛弃整个工具箱,采取不同的方法,”Suriyakumar说。 在了解到这个难题后,研究人员与Thorn合作,以解决这个问题。 **一种非生成式解决方案** 研究人员没有关注输出,而是瞄准了LoRA算法在微调过程中所做的修改。 他们的技术探测这些修改(称为LoRA适配器),以确定模型是否已被专门化用于有害能力,而无需生成输出。 通过一种称为高斯探测的技术,研究人员向模型输入一组随机数据点,并分析模型在其多层内部结构中如何操纵这些数据。 “我们从不运行模型到最终状态,也不提示模型,因此我们从不生成图像,”Suriyakumar解释道。 研究人员在模型内部结构的多个时间点捕获这些修改,并取平均值来总结LoRA适配器如何改变了模型的计算。他们发现这些响应是模型如何被专门化的一个强烈信号。 他们在三种类型的模型变体上测试了该方法,并将结果与已知用于生成CSAM、其他有害图像和安全内容的LoRA适配器的真实数据进行了比较。 该方法在识别已被适配以生成CSAM的模型方面达到了100%的准确率。 “AI带来的儿童安全问题有一大堆,这些都是需要解决的真实问题。许多儿童正受到AI深度伪造的伤害。我们已经证明,高斯探测可以是一个非常实用的工具,我们希望研究界能更多地关注这个问题,”Wilson说。 重要的是,他们的技术是可扩展的,并且实施起来相对廉价。由于每个月有成千上万的模型变体在线发布,可扩展性对于帮助审计人员在有害适配广泛传播之前将其移除至关重要。 高斯探测也比其他一些审计技术更鲁棒,因为恶意行为者需要仔细改变基础模型的内部工作机制才能避免被检测。 未来,研究人员希望在更大的模型变体集合上评估他们的技术,并探索高斯探测是否能在基础模型被适配之前检测出有害能力。 “现在我们有了一种技术方法可以部分解决这个问题。这次合作投入了大量精力,使我们能够解决一个在全国乃至全世界伤害许多儿童的非常棘手的问题。希望我们能在这一领域产生变革性的影响,”Ghassemi说。 这项工作部分得到了Bridgewater AIA Labs Research Fellowship的支持。

相似文章

打击网络儿童性剥削和虐待

OpenAI Blog

OpenAI宣布推出全面的政策和技术措施,以防止其模型被用于儿童性剥削和虐待,包括部署前保护、用户监测、开发者监管以及与NCMEC和Thorn等组织的合作。

OpenAI对儿童安全的承诺:采取安全设计原则

OpenAI Blog

OpenAI及包括亚马逊、谷歌、Meta、微软在内的主要科技公司已承诺在生成式AI的开发、部署和维护中实施“安全设计”原则以保护儿童。该倡议旨在通过模型开发、发布及持续平台安全方面的综合措施,降低儿童性虐待材料生成和传播的风险。

应对现实世界中不良内容检测的整体方法

OpenAI Blog

OpenAI 展示了一套全面的框架,通过精心设计分类体系、控制数据质量、构建主动学习流程以及采用防止过拟合的技术来构建鲁棒的内容审核系统。该方法能够检测包括性内容、仇恨言论、暴力和自伤在内的多个类别的不良内容,性能超越现有的现成模型。

帮助开发者构建更安全的青少年AI体验

OpenAI Blog

OpenAI发布了基于提示的安全策略和开放权重的gpt-oss-safeguard模型,帮助开发者构建适合青少年的AI体验,涵盖图形内容、有害行为和危险活动等风险。