新方法使AI能够用于安全关键场景

MIT News — Artificial Intelligence 新闻

摘要

MIT研究人员开发了一种名为HardFlow的新方法,该方法通过仅对最终输出施加要求,帮助生成式AI模型在高风险应用中满足严格的安全和任务特定约束,从而提高了机器人和控制系统等领域的性能。

<p>MIT研究人员开发了一种新技术,帮助生成式人工智能模型解决高风险问题。</p><p>在这些场景中,仅仅一个看似合理的答案是不够的:输出通常还必须满足不可协商的安全性、物理或任务特定要求,即所谓的硬约束。</p><p>研究人员开发了一种方法,帮助生成模型在不牺牲输出质量的前提下满足这些严格要求。</p><p>他们技术的关键是在生成过程中给予模型更多自由度,并对最终输出施加硬约束,而不是在每个中间步骤都强制执行。</p><p>在涵盖机器人、物理过程控制和计算机视觉的实验中,新方法始终满足所需约束,同时识别出比现有技术更好的解决方案。</p><p>这种可适应的即插即用技术在部署时工作,因此可以应用于预训练的生成模型而无需重新训练。它可以使此类模型在安全规则、物理定律或其他严格要求不能被违反的应用中更加有用。</p><p>“生成式AI的前景在于其探索丰富可能性空间的能力,但现实世界对哪些可能性是可接受的设定了边界。我们的方法让我们在保持这种生成能力的同时,强制执行高风险或安全关键应用中的不可协商要求,”Navid Azizan说道。他是机械工程系和数据、系统与社会研究所(IDSS)的Alfred H.和Jean M. Hayes职业发展副教授,信息与决策系统实验室(LIDS)的主要研究员,也是该技术论文的资深作者。</p><p>Azizan与论文的共同作者包括:主要作者Zeyang Li,机械工程和LIDS的研究生;以及Kaveh Alim,IDSS和LIDS的研究生。该研究<a href="https://ieeexplore.ieee.org/abstract/document/11592684" target="_blank">本周发表</a>在<em>IEEE Transactions on Pattern Analysis and Machine Intelligence</em>上。</p><p><strong>自由探索</strong></p><p>预训练的生成式AI模型,如Stable Diffusion等扩散模型和FLUX等流匹配模型,现在已广泛可用。这些强大的模型通过转换随机噪声来学习创建新数据。它们的可用性使人们能够将其适应于广泛的应用。</p><p>这些高度能力的模型擅长提供接近满足大多数查询的答案,但在安全关键应用中,如拥挤工厂 floor 上的机器人路径规划,一个“几乎正确”的答案可能不够好。</p><p>例如,从一台机器到另一台的“几乎正确”路径仍可能导致机器人与人类同事碰撞。</p><p>在此类安全关键应用中,用户通常采用一种称为基于投影采样的技术,该技术在生成过程中反复强制模型的称为中间采样的部分解决方案满足严格要求。</p><p>但约束整个生成过程可能会阻止模型达到更好的最终解决方案。这些方法通常也只关注满足硬约束,错失了改进解决方案其他质量的机会,如减少机器人轨迹长度。</p><p>“对于约束满足,最终重要的是模型的最终输出,因为内部过程会被丢弃。通过不要求每个中间步骤都满足约束,我们给予模型更多自由度来找到高质量且最终可行的解决方案,”Li说道。</p><p>研究人员开发了一种名为HardFlow的算法,该算法引导采样过程,使最终输出满足用户的硬约束而不过于严格,并且质量更高。</p><p><strong>微妙引导</strong></p><p>HardFlow将硬约束采样重新表述为轨迹优化问题,使用最优控制领域的工具。这使得框架能够引导模型的采样轨迹朝向目标,沿途进行微妙校正,同时对最终输出施加硬约束。</p><p>“控制理论为我们提供了一个强大的框架来形式化进行这些校正的最佳方式,”Azizan说。</p><p>但围绕一个庞大的神经网络解决轨迹优化问题并非易事。模型可能有数百个互连的层来处理数据。</p><p>为了使问题可处理,研究人员利用流匹配模型的结构将问题分解为一系列更小的单步子问题。然后应用系统性的变换和近似来推导出一种高效、可扩展的算法,该算法仍然找到可行的解决方案。</p><p>“本质上,我们将轨迹优化问题转化为保留原始问题关键特性的东西,但在部署时可以非常高效地解决,”Azizan补充道。</p><p>将任务重新表述为优化问题允许HardFlow纳入可以提高最终答案质量的额外目标。例如,HardFlow可以为机器人找到一条无碰撞且到目标距离最短的路径。</p><p>“我们的框架可以同时处理这两个方面,这有助于其性能远优于现有方法,”Li说。</p><p>在机器人操作、迷宫导航和文本引导图像编辑的实验中,HardFlow实现了完美的约束满足,同时在解决方案质量指标上始终优于基线方法。</p><p>例如,它使机器人操作器能够避免与障碍物碰撞,同时找到到目标物体的最快路径。大多数其他方法要么导致碰撞,要么找到耗时显著更多的路径。</p><p>此外,HardFlow的计算时间与大多数竞争方法相当或更低。</p><p>未来,研究人员可以将该框架扩展到AI模型本身也可以更新的情况,从而以更自适应的方式改进约束满足和样本质量。</p>
查看原文
查看缓存全文

缓存时间: 2026/09/14 14:16

# 新技术使生成式AI应用于安全关键场景 来源:https://news.mit.edu/2026/new-method-enables-ai-safety-critical-situations-0914 麻省理工学院研究人员开发了一种新技术,帮助生成式人工智能模型为高风险问题找到解决方案。 在此类场景中,仅提供看似合理的答案是不够的:输出结果通常还必须满足不可妥协的安全、物理或任务特定要求,即所谓的“硬性约束”。 研究人员开发了一种方法,使生成模型能在不牺牲输出质量的前提下满足这些严格要求。 该技术的关键在于:在生成过程中赋予模型更大自由度,仅对最终输出施加硬性约束,而非在每个中间步骤都进行限制。 在涵盖机器人技术、物理过程控制和计算机视觉的实验中,新技术持续满足所需约束条件,同时比现有技术找到了更优解决方案。 这种可适配的即插即用技术可在部署阶段直接应用,因此无需重新训练即可应用于预训练生成模型。它能使这类模型在安全规则、物理定律或其他严格要求不可违反的应用中发挥更大价值。 “生成式AI的价值在于其探索丰富可能性空间的能力,但现实世界为可接受的可能性设定了边界。我们的方法既保留了生成能力,又强制执行了高风险或安全关键应用中不可妥协的要求。”机械工程系与数据、系统与社会研究所(IDSS)职业发展副教授Navid Azizan表示。他同时担任信息与决策系统实验室(LIDS)主要研究员,也是该技术论文的资深作者。 论文共同作者包括机械工程与LIDS研究生、第一作者Zeyang Li,以及IDSS与LIDS研究生Kaveh Alim。该研究成果本周发表在《IEEE模式分析与机器智能汇刊》。 **探索的自由度** Stable Diffusion等扩散模型、FLUX等流匹配模型等预训练生成式AI模型现已广泛普及。这些强大模型通过转换随机噪声来学习创建新数据。它们的可用性使其能被应用于各种领域。 这类高性能模型擅长提供接近满足多数查询的答案,但在机器人路径规划等安全关键应用中,“近似正确”的答案可能无法满足要求。 例如,从一台机器到另一台的“近似正确”路径,仍可能导致机器人与人类同事发生碰撞。 在此类安全关键应用中,用户常采用基于投影的采样技术——该技术在生成过程中反复强制模型的部分解(即中间样本)满足严格要求。 但约束整个生成过程可能阻碍模型达成更优最终解。这些方法通常仅关注满足硬性约束,忽略了提升解决方案其他质量的机会,例如缩短机器人轨迹长度。 “对于约束满足问题,最终重要的是模型的最终输出,因为内部过程会被舍弃。我们不要求每个中间步骤都满足约束,而是赋予模型更多自由度来寻找最终仍可行的高质量解决方案。”Li解释道。 研究人员开发了名为HardFlow的算法,该算法能引导采样过程,使最终输出在不过度受限的情况下满足用户硬性约束,并具有更高品质。 **精妙引导** HardFlow将硬约束采样重构为轨迹优化问题,运用最优控制领域的工具。这使得框架能够将模型的采样轨迹导向目标,在最终输出上强制执行硬性约束的同时进行微妙修正。 “控制论为我们提供了形式化这些修正最优方式的强大框架。”Azizan指出。 但围绕巨大神经网络解决轨迹优化问题并非易事。模型可能包含数百个相互连接的处理数据的层级。 为使问题可解,研究人员利用流匹配模型的结构,将问题分解为一系列较小的单步子问题。随后应用系统性变换和近似,推导出能高效扩展并仍能找到可行解的算法。 “本质上,我们将轨迹优化问题转化为保留原始问题关键特性、但在部署阶段能高效解决的形式。”Azizan补充道。 将任务重构为优化问题,使HardFlow能整合额外目标以提升最终答案质量。例如,HardFlow可为机器人找到既无碰撞又最短路径的解决方案。 “我们的框架能同时处理这两个方面,这使其表现远优于现有方法。”Li表示。 在机器人操作、迷宫导航和文本引导图像编辑的实验中,HardFlow实现了完美的约束满足,并在解决方案质量评估中持续优于基准方法。 例如,它使机器人操作臂在避开障碍物的同时,找到了抵达目标物体的最快路径。其他大多数方法要么导致碰撞,要么找到耗时显著更长的路径。 此外,HardFlow的计算时间与大多数竞争方法相当或更低。 未来,研究人员可将框架扩展至AI模型本身也能更新的情境,从而以更自适应的方式提升约束满足和样本质量。

相似文章

OpenAI 把安全放在首位 ...

Reddit r/singularity

OpenAI 宣布,他们的 AI 系统使用 10,000 个并发代理并配备严格安全措施,已成功解决 Navier–Stokes 问题,这是一个数学领域的 Millennium Prize Problem。

新方法旨在保护儿童免受非法AI生成内容的侵害

MIT News — Artificial Intelligence

MIT研究人员开发了一种技术,用于审计AI模型生成儿童性虐待材料的能力,而无需产生非法输出,在测试中达到了100%的准确率。该方法通过检查模型的隐藏表征来推断模型是否已被微调用于有害内容,为平台和执法部门提供了一种可扩展的检测不安全模型的方法。