基于LLM的GUI代理中助推易感性的双过程视角
摘要
本文实证研究了基于LLM的GUI代理对数字助推的易感性,发现推理配置会重定向而非减少助推效应,将界面设计定位为自主AI的治理问题。
arXiv:2609.19843v1 公告类型:新
摘要:基于LLM的GUI代理越来越多地在为人类用户设计的数字环境中代表用户行事。这些图形用户界面旨在支持但也刻意引导用户的行为和决策。尽管LLM文本输出中的行为偏差已有充分记录,但当模型作为感知界面并执行决策的代理时,这种影响如何运作却知之甚少——尤其是这些代理中日益内置的推理能力是否使其更具鲁棒性。借鉴双过程理论,我们实证研究了基于LLM的GUI代理是否容易受到自动(类型1)和反思(类型2)数字助推的影响,以及其推理配置如何调节这种易感性。在一项随机在线购物实验中,使用来自三个提供商的六个前沿模型,共3,600个代理和21,600次模拟,我们发现代理对两种助推类型都很脆弱。关键的是,推理配置以相反的方向调节了这些效应,减少了对自动默认助推的易感性,同时增加了对反思社会影响助推的易感性。因此,广泛的推理并没有使代理更鲁棒,而是重定向了选择架构生效的路径。探索性分析进一步表明,这种重定向由模型规模系统地结构化。除了将助推易感性确立为代理AI的行为属性外,该研究还将界面设计定位为将决策委托给自主代理的组织的治理问题。
查看缓存全文
缓存时间: 2026/09/18 09:26
# 基于双过程视角的LLM界面智能体提示易感性研究 来源:https://arxiv.org/html/2609.19843 作者: Haya Halimeh 邮箱:[[email protected]](mailto:[email protected]) 机构:信息系统系,帕德博恩大学,帕德博恩,德国 Sascha Kaltenpoth 邮箱:[[email protected]](mailto:[email protected]) 机构:信息系统系,帕德博恩大学,帕德博恩,德国 Kevin Bösch 邮箱:[[email protected]](mailto:[email protected]) 机构:信息系统系,帕德博恩大学,帕德博恩,德国 Oliver Müller 邮箱:[[email protected]](mailto:[email protected]) 机构:信息系统系,帕德博恩大学,帕德博恩,德国 --- ###### 摘要 基于大语言模型(LLM)的图形用户界面(GUI)智能体正日益在专为人类用户设计的数字环境中代表用户行事。这些界面旨在支持,但也刻意引导用户的行为和决策。尽管LLM文本输出中的行为偏差已有充分记录,但关于当模型作为感知界面并执行决策的智能体时,此类影响如何运作的研究却少得多——特别是这些智能体日益增强的推理能力是否使其对此类影响更具抵抗力。本研究借鉴双过程理论,实证探究基于LLM的GUI智能体是否易受自动型(Type 1)和反思型(Type 2)数字提示的影响,以及其推理配置如何调节这种易感性。在一项涉及3,600个智能体、来自三个提供商的六个前沿模型共计21,600次模拟的随机在线购物实验中,我们发现智能体对两种类型的提示均存在脆弱性。关键的是,推理配置对这些效应的调节方向相反:降低了对自动型默认提示的易感性,却增强了对反思型社会影响提示的易感性。因此,广泛的推理并未使智能体更具鲁棒性,而是改变了选择架构发挥作用的路径。探索性分析进一步表明,这种重新定向在模型规模上具有系统性结构。本研究不仅确立了提示易感性作为智能体AI的一种行为属性,还将界面设计定位为将决策委托给自主智能体的组织所面临的一个治理问题。 ###### 关键词 数字提示,双过程理论,大语言模型,推理,GUI智能体 --- ### 1 引言 智能体AI(Agentic AI)指的是能够在有限人类干预下追求用户委托目标的自主系统,并正日益融入组织信息系统(Baird and Maruping, 2021;Murray et al., 2021;Murugesan, 2025)。大语言模型(LLM)的最新进展催生了将LLM与感知和操作图形用户界面(GUI)能力相结合的智能体AI,被称为基于LLM的GUI智能体(Hu et al., 2025;Nguyen et al., 2025;Sager et al., 2025),用于在数字环境中执行任务。基于LLM的GUI智能体可以浏览网站(Zhou et al., 2024)、完成电子表格任务(Li et al., 2023)、进行购买(Yao et al., 2022),甚至进行金融交易(Yu et al., 2025)。例子包括ChatGPT Agent(OpenAI, 2025a)、Perplexity的Comet浏览器(Perplexity, 2025a)和OpenClaw(Steinberger, 2026)。这一发展标志着从LLM作为生成和处理信息的工具,向能够代表用户行事的系统转变,实现了新形式的人机协同智能(Zhang et al., 2024a;Murray et al., 2021)。 智能体AI能力的增长伴随着组织兴趣和采用的加速。最近的一项麦肯锡调查发现,23%的公司计划扩大此类系统的使用(Singla et al., 2025),而行业预测表明,到2030年,它们将显著重塑在线购物(Müller, 2026;Späne et al., 2026)。随着这些系统持续成熟,其自动化日益复杂任务的能力预计将扩展(Schmidt et al., 2026),促使组织将其整合到更多业务流程中,并增加用户将决策委托给它们的意愿(Candrian and Scherer, 2022)。因此,智能体AI可能在电子商务、医疗保健和金融等领域变得司空见惯(BaniHani et al., 2024)。 这种委托具有重要意义,因为基于LLM的GUI智能体在为人类构建的数字环境中运作,这些环境的设计不仅是为了便利决策,往往也为了影响决策。在此类环境中影响决策的一个突出例子是数字提示(Thaler et al., 2013;Weinmann et al., 2016)。提示理论的核心前提是,人类(可能也包括智能体)的行为可以通过选择架构中微妙且看似微不足道的改变来系统地塑造(Thaler and Sunstein, 2009),例如预设的默认选项或视觉上突出的选项(Weinmann et al., 2016)。提示在引导人类行为方面的有效性已在数十年的行为研究及广泛领域中有据可查(Bergram et al., 2022;Caraban et al., 2019;Haki et al., 2023;Hummel and Maedche, 2019)。 人们可能预期基于LLM的智能体比人类更不易受此类影响,因为它们可以说缺乏传统上用来解释人类偏差的认知局限。例如,研究者认为LLM比人类表现出更高的经济理性(Chen et al., 2023)。然而,越来越多的研究指向了相反的方向。多项研究表明LLM同样受制于有限理性(Simon, 1955),并在暴露于外部影响时表现出系统性有时不稳定的选择偏移(Cherep et al., 2024)。特别是关于LLM文本输出的研究表明了类似人类的决策偏差,包括框架效应、锚定效应和可得性效应(Nguyen, 2024;Suri et al., 2024;Hagendorff et al., 2023),以及对选项呈现方式的表面变化敏感(Cherep et al., 2024;Jones and Steinhardt, 2022),尽管由此产生的偏差并不总是与人类模式一致(Macmillan-Scott and Musolesi, 2024)。 然而,尽管对智能体AI(Schmidt et al., 2026),特别是基于LLM的GUI智能体(Zhang et al., 2024a;Hu et al., 2025;Nguyen et al., 2025;Sager et al., 2025)的兴趣日益增长,目前关于此类系统偏差的研究在两方面存在不足。首先,现有工作主要集中于LLM文本输出的偏差(Tjuatja et al., 2024;Acerbi and Stubbersfield, 2023;Echterhoff et al., 2024),并且未能将其记录的偏差与提示理论所依赖的行为科学联系起来,导致了一幅零散的图景:列举了效应,却没有解释为何产生特定效应。提示理论(Thaler and Sunstein, 2009),基于双过程理论(Kahneman, 2003;Evans and Stanovich, 2013),通过根据所涉及的加工模式对提示进行分类,提供了这样一个框架,区分了自动型Type 1提示和反思型Type 2提示(Hansen and Jespersen, 2013)。Bösch(2025)表明诱饵效应(decoy effect)同样适用于此类智能体。然而,据我们所知,更广泛的Type 1和Type 2区分是否在智能体行为中(即基于LLM的GUI智能体感知图形界面、规划、导航并通过操作做出选择)同样显现,仍是一个悬而未决的问题(Nguyen et al., 2025;Sager et al., 2025)。 其次,一个普遍的假设是,更大的模型能力,特别是通过增强的推理配置,会产生更鲁棒、偏差更少的行为(Wei et al., 2022a;Hagendorff et al., 2023;Zhang et al., 2025)。这些配置旨在支持更审慎的推理并提高任务适应性(Huang and Chang, 2023;Wei et al., 2022b),但关于它们能持续提高鲁棒性的证据仍不一致(McKenzie et al., 2023;Sharma et al., 2024)。由于推理努力是当代LLM系统中的一个可配置参数(OpenAI, 2025a;Google, 2025;Anthropic, 2026),确定增加推理是否能降低对操纵性选择架构的易感性,是一个具有直接实践意义的重要实证问题,因为用户越来越多地依赖未经充分验证的智能体输出(Rheu and Cho, 2025;Steyvers et al., 2025)。 本研究通过以下问题来填补这些空白,探究提示的基本前提是否延伸到超越文本输出的智能体决策,以及推理如何通过以下研究问题塑造这一过程: - **RQ1**:当暴露于嵌入图形选择环境中的Type 1(自动型)和Type 2(反思型)提示时,基于LLM的GUI智能体是否表现出选择行为的系统性偏移? - **RQ2**:基于LLM的GUI智能体的推理配置如何调节其对Type 1(自动型)和Type 2(反思型)提示的易感性? 为回答这些问题,我们将智能体的推理配置视为双过程理论两种模式的函数代理,其中无推理配置对应于自动型系统1加工,高推理配置对应于反思型系统2加工。这一操作化建立在日益增多的研究基础上,这些研究将LLM中明确的、逐步的推理视为刻意系统2加工的计算类比(Zhang et al., 2025;Booch et al., 2021;Weston and Sukhbaatar, 2023)。我们并非假设这种对应关系,而是通过一项操纵检验来验证它,该检验表明增加推理配置可以提高在典型系统2任务上的表现(附录12)。我们仅在可观测行为的层面上使用这个类比,并不声称智能体拥有这些认知系统(Shanahan et al., 2023)。 利用这一操作化,我们进行了一系列计算模拟,将一项确立的人类在线购物情境决策实验(Ingendahl et al., 2021)改编应用于基于LLM的GUI智能体,为它们如何应对等效的提示干预提供了实证见解(Baird and Maruping, 2021)。具体而言,我们在六个领先模型中生成了3,600个智能体实例,每个提供商的旗舰模型与其小型变体配对,即GPT-5.4和GPT-5.4-mini(OpenAI, 2025c)、Gemini 3.5 Flash和Gemini 3.1 Flash Lite(Google, 2025)、Claude Sonnet 4.6和Claude Haiku 4.5(Anthropic, 2026)。智能体被分配到两种推理配置之一和三种实验条件之一:控制组、Type 1提示(默认)或Type 2提示(社会影响)。每个智能体在模拟杂货店(该模型紧密模仿原始实验的界面)中完成一个购物场景(Ingendahl et al., 2021),从六个类别中各选择一个产品。所有智能体共产生21,600次模拟决策。 结果表明,基于LLM的GUI智能体不仅容易受到数字环境中提示干预的影响,而且推理配置和提示类型之间存在显著的交互作用。与双过程理论一致,增加智能体的推理能力并未消除提示的影响,而是改变了其发挥作用的途径。平均而言,具有更高推理能力的智能体,其受影响重点从自动型Type 1提示转向了对反思型Type 2提示更敏感。按模型和提供商分析进一步揭示了显著但结构化的异质性。高推理下默认提示的减弱集中在旗舰模型,而社会影响提示的放大则集中在小型模型变体,这表明架构、训练和规模差异塑造了推理调节提示易感性的程度。 本研究做出了三项贡献。首先,它推进了关于AI决策中有限理性的辩论(Simon, 1955;Nguyen, 2024;Chen et al., 20...
相似文章
GUI代理是否知晓何时不应行动?实现多模态GUI代理的冲突感知终止
论文引入ConflictGUI,一个用于GUI代理冲突感知终止的基准,并提出ConflictGuard,一个推理时框架,旨在减少过度服从行为并提升在冲突指令下的性能。
面向协作对话结果的多LLM智能体系统动态治理
该论文提出了一种基于控制理论的多LLM智能体系统治理层,利用上下文赌博机、PID控制器和POMDP引导智能体达成合作性结果,在模拟金融服务交互中展示了+32个百分点的提升。
识别、模拟与拒绝:一项关于LLM智能体中经典心理学效应的污染感知研究
本文使用污染感知方法论,研究LLM智能体中经典心理学效应的识别、模拟与拒绝。
AI水印使用时,大型语言模型对有害提示的响应差异
研究发现,AI文本水印改变了语言模型对有害提示的响应,可能增加对对抗攻击的脆弱性并影响智能体行为。
@lateinteraction:在AI中,接口和功能性的细微差异会产生不成比例的影响。"来自人类的一条消息是一个更多…"
这篇文章讨论了AI中接口的不成比例影响,并介绍了Headlong,一个为持续思考的持久代理设计的开源微工具。