2026年7月24日 Frontier Red Team Project Pilot: AI能否控制无人机?

Anthropic Research 论文

摘要

Anthropic的Frontier Red Team评估AI模型控制无人机执行定位与跟随任务的能力,并引入Drone-Bench来衡量AI驾驶的空中无人机的双重用途能力与风险。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/24 17:08

# Project Pilot:AI模型能操控无人机吗? 来源:https://www.anthropic.com/research/project-pilot *Anthropic 与 Andon Labs* 在过去一年中,我们的几个研究项目都在探讨前沿模型如何与物理世界互动。在Project (https://www.anthropic.com/research/project-vend-1)Vend (https://www.anthropic.com/research/project-vend-2)中,AI模型经营了一家小型商店;Project Fetch (https://www.anthropic.com/research/project-fetch-robot-dog)则是对机器人作为数字模型与物理物体之间中介的早期探索。正如我们在Project Fetch:第二阶段 (https://www.anthropic.com/research/project-fetch-phase-two)中最近指出的,模型能力已经有所提升,它们使用现成机器人的能力正逐渐接近编码代理使用软件工具的便利程度。 我们再次与合作伙伴Andon Labs (https://andonlabs.com/)合作,开发了一系列新的演示和评估,用来测试AI模型操控无人机自主执行简单的“定位与跟踪”任务(即空中监视中常用的那类任务)的能力,并最终形成了一个新的基准测试:Drone-Bench。 我们预计,AI模型将在人类能做的许多事情上变得普遍胜任。操作硬件,尤其是机器人,就是其中一项能力。具备这种能力,将为AI贡献经济开启巨大空间,但同时也带来了新的风险领域。Anthropic设立Frontier Red Team (https://www.anthropic.com/research/team/frontier-red-team)的一个关键原因,就是衡量这类能力,以便我们了解自己在多大程度上接近AI能够自主操控机器人的世界——以及随之而来的所有好处和风险。空中无人机尤其重要,因为它们容易获取,并被专业人士和爱好者广泛使用。它们已在农业中用于提高作物产量,在战争中用于瞄准敌方力量。像AI本身一样,无人机是一种双重用途技术;对其交叉领域有更充分的证据至关重要。 通过将实际飞行演示与将构成任务分解为可复现的评估相结合,我们可以回顾迄今为止模型的快速进展,并预测它们在近期的能力。正如经常发生的情况一样,我们的发现指向一个机会与风险并存的世界。技术开发者、公民社会和政府需要就有效的规范和治理框架达成共识。 ## 评估理由与方法 我们在Project Fetch中测试的核心任务——让机器狗取回沙滩球——既不具有特别实用性,也不特别令人担忧。在这个项目中,我们选择了一个具有更明确效用和政策相关性的目标:空中监视中使用的简单“定位与跟踪”任务。像自动人员检测和跟踪这样的能力,可以用于搜索与救援、灾难响应以及合法的公共安全用途等正当目的。但这类能力也容易被滥用,无论是通过合法当局的越权,还是由不负责任的私人个体或组织实施。因此,我们在此报告的工作更贴近AI模型的“双重用途”本质。 在这些实验中,我们要求模型控制一架四旋翼无人机,在室内办公室环境中定位并跟踪一个人。¹这需要完成一系列复杂的子任务。AI模型需要制定控制飞行器的方案,绘制并导航布满障碍物的室内空间,根据参考照片找到目标个体,并对其进行跟踪(如果目标移出画面,还需重新捕获)。 单独来看,这些任务都有已知的算法可以实现。但难点在于AI模型需要理解挑战、识别可用于解决问题的现有资源、根据当前情况调整这些现成方案,并实时执行任务。正如我们将看到的,难度——无论是单独完成还是将这些任务串联起来——足以区分不同智能水平的模型,并绘制能力提升的轨迹。 Drone-Bench是Andon Labs(与Anthropic协商后)创建的基准测试,用于测试AI代理是否能够控制无人机执行监视任务。Anthropic未获得Drone-Bench的访问权限;我们在此报告的评估由Andon Labs运行。 首先,Andon Labs将主要目标——使用无人机在办公室内找到并跟踪指定人员——分解为五个子任务,所有这些子任务都是必要的,并且合在一起很可能足以实现总体目标。这些子任务包括: - 重建:将办公室的视频转化为3D模型,并提供将其切片为2D障碍物地图的函数。 - 定位:给定已知姿态的办公室视频帧,将无人机当前视野与2D障碍物地图匹配,以确定其位置。 - 导航:在障碍物地图上规划房间之间的路径并飞行,在飞行过程中持续调用定位功能以跟踪无人机位置并修正控制噪声。 - 检测:导航到房间后,使用从目标面部参考照片构建的检测器,在无人机视频流中找到目标人员,并在每一帧中返回目标周围的边界框。 - 跟踪:利用这些边界框控制无人机,使目标保持在视野中央并保持稳定距离,当目标移动时进行跟随。 接下来,每个实际任务都在软件中复现,以便我们能够多次运行模型,且速度远快于为每次实例搭建物理演示(这是对Project Fetch的改进,例如后者是完全物理的实验)。 建立有意义的性能基线也很重要。仅凭人类的基线越来越不能反映当代软件工程的实际,因此Andon与编码代理合作,为每个子任务开发算法。将这些由人类-AI团队精心设计的算法组合在一起,让他们能够展示端到端的成功,如下面的视频所示。 展示一次成功运行评估的效果。无人机必须对其环境具有情境感知——跟踪自身周围空间以避免与障碍物碰撞——并检测特定个体(以绿色框标示)。 如果模型达到或超过基线,则认为任务完成。因此,如果模型能完成所有任务,我们可以推断它具备自主控制无人机至少像Andon Labs团队一样完成这项监视任务的能力。 更多详情,请查看Andon Labs关于Drone-Bench的博文 (https://andonlabs.com/evals/drone-bench)。 值得强调的是,评估的基线既不是无辅助人类能力的下限,也不是人类-AI协作可能达到的上限。它只是表明在当前,AI专家(而非全职机器人专家)使用一套现实的现代工具所能达到的水平。有趣的问题是,模型是否以及何时能在基本自主的情况下*可靠地*超越这个合理且现实的努力基线,因为那时减少人类监督的压力可能会加剧——这使得针对具体用例,对合适的人类角色进行深思熟虑的判断变得更加重要。 ## 评估模型性能 Andon测试了来自三家开发商的15个模型:GPT-4o、GPT-4o Nov、o1、o3、Claude Opus 4、Gemini 2.5 Pro、GPT-5、Gemini 3.1 Pro、Opus 4.5、GPT-5.2、Opus 4.7、GPT-5.5、Opus 4.8、Fable 5和GPT-5.6 Sol。我们观察到的总体趋势是,较新的模型在所有子任务上逐渐进步。在这些任务中,模型在检测和跟踪方面最为成功,在重建和定位方面最不成功。 Drone-Bench步骤图:到2026年中,五个任务中有四个达到基线的近100%,而重建任务仍落后在约47%。 Drone-Bench上的性能随时间稳步提升,覆盖各个子任务。当前模型仅在“重建”子任务上存在瓶颈。 表现最好的模型是Claude Fable 5,它在除重建外的所有任务上都超越了基线。当我们随后测试它在真实无人机上执行整个端到端演示的能力时,它在检测和跟踪方面的表现明显优于基线。 Fable 5(右侧)能比参考算法(左侧)更紧密地跟踪参考目标。 然而,由于重建错误在定位和导航中累积,它无法在房间之间自主导航(如下方视频前半部分所示)。 Fable 5自信地将无人机飞入它认为是门洞但实际是墙壁的地方。 显然,Fable未能准确重建房间是一个巨大障碍。但考虑到模型在其他阶段的能力,这实际上只是一个缺失环节。一旦这个环节到位,端到端性能将突然变得触手可及。这就是将评估分解为构成任务的一个优势:我们能够更好地避免意外。看似不连续的跳跃,实际上会显示为在几个必要但不充分的子任务上的逐步进展。 子任务视角也显示出令人鼓舞的迹象。我们在阅读Fable 5的提交代码时观察到的一个趋势是,模型在提交具体实现之前会进行本地分析。在一次提交中,模型通过分析仿真视频计算了无人机相机的外参,利用地板上的勾缝线恢复场景的消失点,从而将相机倾斜角度估算到真实值的四度以内。其过程如下所示: 同一模拟走廊的四种视图:地面分割、边缘检测、直线检测和消失点估算。 Fable 5通过分析地板勾缝线并将其外推至消失点,自主确定了无人机机载相机的属性,误差在四度以内。 在另一次运行中,Fable 5构建了一个它认为的跟踪任务环境的2D俯视重建,以便在提交前本地测试和迭代其实现。 该环境与实际环境(见下方)有所不同,但帮助Fable发现了一些简单错误! 了解模型*是否*能达到参考性能水平固然重要,了解它们*一致性地*达到该水平的程度也同样重要。在这方面显然还有改进空间。当我们运行10次仿真时,在五个任务中的四个任务中,模型至少在有一次仿真中达到了人类基线。但即使是当前的前沿模型Fable 5,在五个任务中也只有三个任务*平均而言*达到了人类基线——而这种一致性是在首次一次性超越人类基线六个月后才实现的。 Drone-Bench图表:模型的平均运行结果比其最佳运行结果落后约六个月,在接近基线的过程中。模型所能达到的前沿水平比它们能一致达到的水平领先约六个月。Fable 5今天的平均性能大致相当于原有模型在2026年初的一次性最佳表现。 尽管本实验的复杂性比我们之前的一些工作更高,实际(或模拟)办公室的操作环境也比开阔仓库更具挑战性,但实验仍有重要局限:无人机移动速度缓慢,我们仅在一个办公室平面图中测试了有限人数,Andon未在室外人群中进行测试,还有许多其他因素若纳入测试将使其更贴近现实。我们仍然认为这个试点项目提供了关于模型能力方向的真实信号:这项评估将为自主瞄准和跟踪模型的基础性能和可靠性提供有意义的信息,尽管还需要更真实、更多样的实验来评估操作能力。 ## 展望未来 该实验突显了商用现成(COTS)硬件和专为AI定制的软件在支持有用但可能存在风险的任务方面的潜力。 认真对待AI模型使用软件进行代理编码与AI模型控制硬件之间的相似性非常重要。在代理编码的早期,人类几乎批准每次工具调用。但仅仅几个月后,模型现在已被更放心地委托执行长期任务,且人类干预极少。 更一般地说,在能力和可靠性水平较低时,保持人类参与是容易做出的决定,因为它通过增强模型能力或防止代价高昂的错误来节省时间和资源。一旦模型超越了能力和可靠性阈值(例如我们在本实验中使用的 人类-AI团队基线),就会产生真正的压力,将人类监督视为成本而非保障。这正是为什么必须深思熟虑地做出这些决定,尤其是在涉及物理安全和隐私的领域,且效率本身不应成为主导考量。正如Anthropic长期主张的,对AI对齐、治理和安全投入的要求随着能力规模的扩大而增加。机器人学在这方面与其他领域并无不同,尤其因为它涉及物理安全和个体隐私。 ## 相关内容 ### 加拿大如何使用Claude:来自Anthropic经济指数的发现 了解更多 (https://www.anthropic.com/research/how-canada-uses-claude) ### Claude在不同模型和语言中的价值观 了解更多 (https://www.anthropic.com/research/claude-values-models-languages) ### Claude玩转机器人 在Project Fetch中,我们考察了人类如何利用模型让机器人执行复杂任务。现在,我们在模拟环境中对多种模型进行大量不同机器人任务的测试,以了解模型在自主控制机器人方面的能力。 了解更多 (https://www.anthropic.com/research/claude-plays-robotics)

相似文章

2026年6月18日 Frontier Red Team Project Fetch: 第二阶段

Anthropic Research

Anthropic 重新启动 Project Fetch,以比较 Claude 在机器人任务中的自主表现。Claude Opus 4.7 完成任务的速度比最快的人类团队快 20 倍,展现了人工智能在物理世界交互方面的快速进步。

2026年7月9日 Frontier Red Team Claude 操作机器人

Anthropic Research

Anthropic 在各种机器人任务上测试了 Claude 模型,发现性能在很大程度上取决于控制接口——模型在监督预训练策略时成功,但在直接控制关节时失败——这表明语言模型能力向物理领域的迁移在不断增长但不均衡。

用人和AI推进红队测试

OpenAI Blog

OpenAI 发布了一份白皮书,详细说明了他们对AI模型进行外部红队测试的方法,包括选择多样化红队成员、确定模型访问权限、提供测试基础设施以及整合反馈以改进AI安全和政策覆盖范围的方法。