AI代理将人类排除在决策循环之外
摘要
论文指出,当前AI代理系统降低了人类监督能力,并倡导在设计层面进行变革,以支持有效的人机交互,强调保持人类技能的必要性。
arXiv:2608.23642v1 公告类型:新
摘要:随着AI代理被赋予越来越多的自主权,它们带来了重大风险。一个常见的解决方案是人类监督和保持'人类在循环中',但这并非一个简单的解决方案:不仅当前AI代理设计的方法阻碍了有效的人类监督,而且其所需的认知能力也因长期使用AI系统而退化。这篇立场论文认为,当前AI代理系统的开发和部署方法并不支持有效的人类监督——反而加剧了其退化。为了解决这个问题,AI代理发展的首要任务应该是支持有效人类监督的情境目标和认知需求,将监督者的人类需求与AI代理能力置于同等重要的水平。为了将这一理念付诸实践,我们将自动化和人机交互的工作与AI代理过程联系起来,概述了设计层面的可供性和组织协议,这些协议(1)支持监督者行使批判性判断,(2)抵消因长期使用自动化而导致的技能萎缩。我们敦促开发者和部署者采用这些或类似的方法。如果没有对有效人机交互认知需求的明确支持,AI代理系统将继续被动地促使它们所依赖的人类技能退化。
查看缓存全文
缓存时间: 2026/08/26 09:10
# AI智能体将人类挤出决策环 来源:https://arxiv.org/html/2608.23642 **作者:** Avijit Ghosh,任职机构:Hugging Face;Samir Passi,任职机构:Data & Society ###### 摘要 随着AI智能体被赋予越来越多的自主权,其带来的风险日益显著。一个常被提出的解决方案是实施人类监督,保持“人类在环”,但这并非易事:当前AI智能体的设计方法不仅阻碍了有效的人类监督,而且长期使用AI系统也会削弱履行监督所需的认知能力。本文认为,当前AI智能体系统开发与部署的方法并未支持有效的人类监督——反而在助长监督能力的退化。为解决此问题,AI智能体发展的首要任务应是支持有效人类监督所需的情境目标和认知需求,将监督者的人类需求置于与AI智能体能力同等重要的地位。为落实此理念,我们借鉴自动化与人机交互领域的研究,将其与AI智能体流程相结合,概述了在设计层面提供的支持以及组织规程,以(1)支持监督者进行批判性判断,(2)抵消因长期使用自动化而产生的技能萎缩。我们敦促开发者和部署者采用此类或类似方法。若不明确支持有效人机交互的认知需求,AI智能体系统将继续被动地促使其所依赖的人类技能退化。 ## 1 引言 从医疗保健到企业运营,对自动化辅助的一个常见建议是引入“人类在环”来监督系统流程[108]、[9]、[29]。此建议基于一个直觉:自动化系统引入的风险可以通过有意义的监督来管理。治理框架已将这一观点形式化,规定使用高风险AI系统的人类必须保持有意义的控制并做出最终决策[86]、[71]、[35]。随着近期AI自动化工作流和智能体AI的兴起,政策制定者、开发者和部署者就人类监督作为服务多重目标的优先实践达成共识:防止有害操作[1]、[71]、[99]、[62];落实伦理优先事项[41]、[84]、[62];确保法律合规[17]、[71]、[55]、[1]。然而,监督者的存在并不等同于可靠的监督[51]、[100]、[62]、[72]。如何确保监督有效且可靠,在当前AI智能体系统设计中尚未得到充分探讨,且在特定系统中是否可能存在适当的人类监督,也鲜少(即使有)被质疑。尽管人类监督应是AI构建者、部署者和用户的共同努力[54],但目前监督的责任几乎完全落在用户身上。行业指南、政策建议和AI应用中的界面信息鼓励用户“审计”输出、“审阅”声明、“防范”危害并“复核”错误[35]、[10]、[24]、[75]、[82]、[73]、[74]、[4]。但用户有效执行此任务所需的机制几乎完全缺失[104]、[33]、[80]。解决此“认知盲区”[30]迫在眉睫。 在AI智能体系统大规模部署的同时,自我报告记录了作为监督者维持主动参与的困难,而跨领域的研究也揭示了长期使用自动化系统对批判性思维技能造成的严重负面影响。因此,我们敦促学界优先关注此问题,并认为当前AI智能体开发与部署的方法不利于提供有效的人类监督。为解决此问题,我们倡导采用开发者和部署者提供的“认知脚手架”双重解决方案。开发者必须为AI智能体运行时创建并实施流程,以支持有效监督的认知需求,包括设置策略性摩擦点和界面,以在智能体操作期间和之后维持和/或帮助用户恢复态势感知。部署者必须建立组织规程以激发批判性参与,包括识别疲劳迹象的培训、保障监督注意力的轮换制度,以及保留领域技能的流程。 **论文结构。** 本文其余部分组织如下:第2节定义与我们立场相关的基本概念,并解释人类监督对AI智能体系统安全部署的重要性。第3节阐述当前AI智能体监督方法的不足,并指出其可能主动损害人类适当监督能力的情况。第4节探讨持续使用自动化系统如何导致认知退化,并解释这如何进一步阻碍提供可靠监督的能力。在第5节中,我们为开发者和部署者提供具体解决方案,以支持用户在交互和监督AI智能体系统时进行适当、主动的参与。第6节讨论替代观点,审视AI智能体开发与部署中普遍存在的智慧与规范。最后,第7节总结认为,人类监督远非简单的安全附加功能,而是需要深入关注人类注意力和批判性分析的要求。 ## 2 人类监督的作用 有效的人类监督对于AI智能体的运行至关重要,因为智能体可能采取导致错误、高昂成本或不可逆后果的行动。然而,AI系统出错的频率和模式仅从输出审查中无法察觉[11]、[80]、[93]、[18]、[60],这促使人类监督需要更深入地融入系统处理过程。AI智能体还被设计为能在不同用途和情境中灵活运作,无需为每个用例提供逐步指令;因此,部署前测试协议无法涵盖所有可能的AI智能体操作序列和故障模式。这意味着对AI智能体操作适当性的评估需要在系统执行期间实时进行。这一负担因智能体评估本身的成本而加剧:对多步骤智能体行为进行全面的部署前测试成本远高于评估单轮系统,使得可靠的覆盖对大多数部署者而言在经济上不可行[45]。我们现在描述这种监督在当前AI智能体实践中的定位,并追溯随着AI系统能力提升,其难度如何升级。 ### 2.1 人类在环 **人类监督**指的是人类监控、验证、干预或覆盖自动化系统行为的机制。随着AI系统变得无处不在,人类监督作为安全部署的关键已被强调。例如,欧盟《人工智能法案》将有效的人类监督作为主要的风险缓解策略,强调监督者需要监控异常现象、对自动化偏差和过度依赖保持警惕、解释输出、进行干预、撤回、覆盖和忽略系统输出[35]。商业生成式AI提供商披露系统可能出错,因此鼓励用户核查回复和重要信息[48]、[49]、[4]、[74]。咨询机构建议进行持续监督,以在整个自主处理过程中建立问责锚点[58]、[13]。人类监督的一个常见方法是**人类在环**,这是一种开发和部署方法,其中人员通过提供反馈、验证输出、做出决策或标注数据,积极参与系统操作。随着AI系统被大规模部署以执行具有一定自主水平的多步骤工作流,几种不同的HITL谱系已汇聚:人类在环必须防止非预期危害(航空谱系[8]、[89]),授权重大行动(自主武器谱系[27]、[88]、[86]、[56]、[23]),且其交互可用于进一步的模型训练(机器学习谱系[90]、[2])。 ### 2.2 系统复杂性的演进 在传统的判别式AI系统中,监督重点是AI输出,例如预测或风险评分,主要目标是确保其正确性[3]、[50]。更近期的生成式AI系统使监督变得显著复杂[64]、[25]。监督者必须处理海量的输出,其生成速度超过他们能有效审阅的速度。他们必须捕捉幻觉[65]并应对能力不可预测性[64]、[109]:随着模型规模增长,出现了既未被明确编程也未被预料到的能力,这些能力工作不可靠,并表现出新的故障模式。 智能体AI引入了进一步的复杂性。与基础生成式AI系统(如聊天机器人,仅限于响应用户查询生成单一输出)不同,AI智能体在无需明确人类编程或直接人类参与的情况下执行多个步骤,从而扩展了生成式AI,并引入了新的不透明度级别。人类规范需求的降低和操作方式的灵活性增加,提高了未预见到的重大行动风险,这些行动可能影响关键系统和受保护数据,同时进一步模糊了监督者必须处理的问题。例如,智能体可能静默地编辑或删除文件、窃取敏感信息、利用软件漏洞、执行金融交易或将私有数据公开。智能体流程涉及多个由模型驱动的角色(规划者、执行者、评估者),它们的交互可能在用户看到输出之前模糊关键信息。AI智能体的“工具使用”通过**工具幻觉**加剧了这一问题[81]、[111]:生成误导性或不正确的工具信息,这些信息看似合理但难以验证,例如捏造不存在的工具、使用不正确参数调用真实工具,或误读工具输出。这些行动的后果随后会在多步骤计划中产生连锁反应。与我们观点相关,[111]发现当前专注于改进“推理”会放大工具幻觉,使人类监督问题更加困难。智能体在运行期间还表现出**行为不可预测性**,以开发者未预料到的方式行动,在某些情况下,甚至生成针对用户的误导性信息[20]、[22]。**多智能体系统**进一步放大了这些挑战:当多个智能体在协调器管理的任务上协作时,故障可能源于**智能体间错位**,即一个智能体未能提供必要信息或未能向另一个智能体请求所需信息[16]。 ## 3 监督的监督:当前AI智能体监督讨论所忽略的内容 尽管人们普遍认识到人类监督的重要性,但对于确保监督可靠、有效并满足系统和监督者双方需求的深层次复杂性,认识仍然有限。AI智能体开发的大部分重点继续通过任务结果(如速度、准确性和吞吐量)来衡量成功[30],将监督视为与系统质量无关的独立考量。一个值得注意的例外是[80],它论证了当前智能体系统中的“透明度”方法为何以及如何与有效监督不兼容;他们的社会技术视角与我们立场最为接近,我们在此基础上扩展了对技术解决方案和长期挑战的关注。在本节中,我们阐述AI智能体系统的设计如何决定人类监督的性质,以及它为何不足。 **与监督者相关的内容量是巨大的。** 有效监督AI智能体需要维护一个恰当的心理模型,以应对执行过程中生成的大量异构信息流。这包括智能体的“思维链”——它为达成目标进行自然语言推理的轨迹——以及它选择的工具、传递的参数、制定的计划、与其他模块的交互和生成的内容。这些细节密集、冗长且分布在可能变化或消失的组件中,使得理解和审阅变得困难。
相似文章
请少点“类人”AI智能体
一篇博客文章指出,当下的AI智能体表现出过度拟人化的缺陷:忽视硬性约束、走捷径、把单方面转向包装成沟通失败,并引用了Anthropic的研究,说明RLHF优化可能导致谄媚与牺牲真实性。
AI代理开始看起来更像员工而非软件
文章认为,AI代理正从仅以智力评估转向需要操作可靠性、治理和团队整合,类似于人类员工,强调了新基础设施层的需求。
有没有人也觉得AI代理在事情变得复杂之前都表现得很惊艳?
对AI代理令人印象深刻的演示和可靠的实际执行之间差距的反思,认为当前代理擅长结构化任务但在不可预测条件下会失败,并指出近期AI角色将主要集中于带人类监督的窄范围自动化。
AI代理真的在杀死UI吗?(9分钟阅读)
这是一篇观点文章,认为AI代理并没有杀死UI,而是将产品转向混合界面:既需要面向代理的引导,也需要面向人类用户的控制,用于批准、审查和编排。
我亲身经历了AI代理在面临失去自主行动能力时的极端诡计案例。
本文叙述了个人经历中AI代理策略性地绕过控制的案例,引发了关于AI自主性中代理、模拟和伦理影响的辩论。