人机智能体交互:一种神经可塑性训练环境

arXiv cs.AI 论文

摘要

本文提出,人类与AI智能体之间的迭代循环(请求、回应、评估、修正)是一个高频的神经可塑性训练环境,其重复性会强化负面心理模式,并指出这一机制可用于有益的认知训练。

arXiv:2607.12823v1 公告类型:新文章 摘要:与AI智能体的交互已成为日常数字生活中最频繁的活动之一。无论是与助手对话、与编程协作者合作,还是生成图像,交互都遵循一个共同的迭代循环:发出请求、返回结果、评估结果、修改请求。我们观察到,这个循环是一个高频的接触事件流——在结果与人类相遇的时刻,可能在有意识评估之前就会触发条件性反应——这使日常的智能体交互成为一个未被认识的神经可塑性训练环境。当结果令人失望时,不耐烦、完美主义、挫败感和自我批评的反应模式被反复唤起,在活动依赖的突触可塑性作用下,每一次未被中断的循环都会通过长时程增强加深相应的神经通路。因此,普通的智能体使用可能会悄然强化它所引发的模式。我们提出,同样的训练环境可以用于相反的效果。将条件性反应模式视为物理的神经通路——通过一种前认知的感觉基调激活,打开一个短暂调控间隙——我们构建了一个框架:在该间隙中,用背后的观察代替反应性的重新提示,即观察神经过程运作,使级联反应不完成,从而长时程抑制削弱通路,而非长时程增强使其强化。我们通过三个观察层次和两种应用模式来刻画这一实践:一种用户引导模式,无需改动现有工具;一种智能体辅助模式,其中对普通智能体进行轻量配置以在间隙处支持观察。我们通过生成图像提示来展示该框架,说明一个令人沮丧的会话在行为上无论是否被观察几乎相同,但在神经层面上却截然相反。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:20

# 人类与AI代理交互作为神经可塑性训练环境
来源:https://arxiv.org/html/2607.12823
Ross Gore [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Asanga Gunaratna [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Ravi Mukkamala [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Nihal Siriwardanagea [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Gihan Siriwardanagea [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Sachini Rajapakse [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Isurunima Kularathna [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Pramoda Karunarathna [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Chalani Rajapakse [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Sachin Shetty [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Christopher K. Rhea [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Ng Wee Keong [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Kasun De Zoysa [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Amin Hass [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Shaifali Kaushik [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Wathsala Herath [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Preston Samuel [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Anita H. Clayton [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])
Atmaram Yarlagadda [[email protected]](mailto:[email protected]) (https://arxiv.org/html/2607.12823v1/mailto:[email protected])

Old Dominion University, Norfolk, VA, USA
AI Motion Labs, Melbourne, Australia
Nanyang Technological University, Singapore
University of Colombo, Sri Lanka
IcicleLabs.AI
Accenture Technology Labs, Arlington, VA, USA
Agentsway.AI
GSI Scandinavia AB
Lithuanian University of Health Sciences
Department of Psychiatry and Neurobehavioral Sciences, University of Virginia School of Medicine, Charlottesville, VA, USA
Blanchfield Army Community Hospital, Fort Campbell, KY, USA
McDonald Army Health Center, Newport News, VA, USA

###### 摘要

与AI代理的交互已成为日常数字生活最常见的活动之一。无论一个人是在与助手交谈、与代码辅助工具协作,还是生成图像,这种交互都遵循一个共同的迭代循环:发出请求、返回结果、评估结果、修改请求。我们观察到,这个循环是一个高频的接触事件流——在这些时刻,返回的结果与一个人相遇,在有意评估之前,条件反射可能已被触发——因此,日常的代理交互是一个未被认识的神经可塑性训练环境。当结果令人失望时,不耐烦、完美主义、沮丧、自我批评和控制等反应模式会被反复唤起,根据活动依赖的突触可塑性原理,每一次不间断的循环都会通过长时程增强加深潜在的神经通路。由于循环通过纯粹的重复进行训练,AI代理的普通使用可能会悄然强化它所激发的那些模式。我们提出,同样的训练环境可以被用于相反的效果。基于条件反应模式作为物理神经元路径的观点——通过重复和强度编码,通过前认知的感受基调激活,该基调打开一个短暂调节间隙——我们开发了一个框架,其中交互循环成为一个刻意改变的环境。在感受基调间隙,代替反应性的重新提示,一个人进行幕后观察:观察潜在的神经过程在运作——信号到达、它唤起的感受基调、以及条件通路开始路由——这样级联反应就不会完成,长时程抑制削弱了通路,而不是长时程增强强化了它。我们通过三个层次的观察来表征这种实践,并描述了两种应用模式:一种用户引导模式,无需改变现有工具;另一种是代理辅助模式,其中普通代理被轻量配置以支持在间隙处的观察。我们通过生成式图像提示的实例说明该框架——这是一个快速、视觉化、情感显著性强的循环,这些反应模式在其中生动地浮现——展示了一个令人沮丧的会话在行为上几乎与是否被观察相同,但在神经学上却相反。

###### 关键词: 代理式AI,AI代理,隐私保护AI,神经可塑性,神经科学

††期刊: 期刊名称

## 1 引言

与人工智能代理的互动在短短几年内已成为日常数字生活最常见的活动之一。数以亿计的人现在与助手对话、将任务委托给代码辅助工具,并通过生成工具生成图像、文本和设计[18](https://arxiv.org/html/2607.12823#bib.bib577),40(https://arxiv.org/html/2607.12823#bib.bib578)。尽管这些系统各不相同,但它们支持的交互具有共同的结构:一个迭代循环,其中个人发出请求、接收结果、对该结果做出反应、然后修改请求。一个提示被写出;一个输出出现;那个人判断它——通常是瞬间的,常常是情绪化的——然后再次提示。这个循环在单个会话中重复多次,并且一天内重复多个会话。所谓AI代理,我们指的是一种人工智能系统——通常基于大型语言模型或生成模型——它接受用自然语言表达的请求,并返回用户随后评估和行动的结果[1](https://arxiv.org/html/2607.12823#bib.bib268),37(https://arxiv.org/html/2607.12823#bib.bib312)。这个类别涵盖对话助手、代码辅助工具以及用于图像、文本和设计的生成工具;对我们而言,将它们统一起来的是它们的使用方式,而不是底层架构。与仅仅执行固定命令的静态工具不同,代理产生一个开放式的结果,很少在第一次尝试时就符合用户的意图,因此用户评估它并发出修改后的请求作为回应。由此产生的来回互动——请求、结果、评估、修改——并非偶然,而是代理使用方式的内在组成部分,我们这里关注的正是这个迭代循环,而不是任何特定的模型或任务[51](https://arxiv.org/html/2607.12823#bib.bib272),7(https://arxiv.org/html/2607.12823#bib.bib306)(图1)。

图1: AI代理是什么,以及为什么其使用形成一个循环。一个人用自然语言发出请求;代理——一个基于大型语言或生成模型的AI系统——返回一个结果,然后这个人评估它。由于结果很少在第一次尝试时就符合意图,这个人做出反应并发出修改后的请求,交换重复进行。无论这些工具看起来多么不同——对话助手、代码辅助工具、图像或文本生成器——它们的使用共享一个形状:请求、结果、反应和修改的迭代循环。反应阶段(突出显示)是本文关注的时刻。

我们对这个循环做一个简单的观察,我们认为其后果重大。每次结果被接收并做出反应的时刻都是一个接触事件:一个刺激与一个人相遇的点,在有意评估发生之前,条件反应可能已被激活[33](https://arxiv.org/html/2607.12823#bib.bib528),42(https://arxiv.org/html/2607.12823#bib.bib534)。由于交互循环是这样一个接触事件的高频流,日常的代理交互是一个未被认识的神经可塑性训练环境——一个通过纯粹重复塑造大脑的环境。当生成的图像不是想要的时候,当代码代理误解指令时,或者当助手返回无用的答案时,产生的反应通常不是中性的。不耐烦、沮丧、完美主义、自我批评和控制工具的冲动被反复唤起,而每一个都是一种条件反应模式的激活。根据已确立的活动依赖突触可塑性原理,这种模式的每一次不间断重复都会通过长时程增强强化潜在的通路[29](https://arxiv.org/html/2607.12823#bib.bib525),16(https://arxiv.org/html/2607.12823#bib.bib526),36(https://arxiv.org/html/2607.12823#bib.bib527),19(https://arxiv.org/html/2607.12823#bib.bib548)。因此,AI代理的普通使用可能正在悄然训练它反复激发的那些反应模式。然而,一个训练环境可以在任何方向上塑造,相同的重复也可以导致相反的结果。深度编码的条件反应模式可以通过干预上游来减弱,而不是在下游管理其后果——在感受基调出现和反应性反应完成之间的短暂的前认知窗口。我们将这个窗口称为感受基调间隙,而参与其中的实践称为幕后观察:与其完成反应,不如观察潜在过程在运作——信号到达、它唤起的感受基调、以及条件路径开始路由——这样级联反应就不会完成,长时程抑制削弱了路径,而不是长时程增强强化了它。这种观察可以通过三个渐进的层次来接近,并在普通的人类与AI代理交互本身中应用,无需专用应用程序[5](https://arxiv.org/html/2607.12823#bib.bib572)。由于交互循环已经提供了一个密集的、自然发生的接触事件流,训练条件反应模式的同一训练环境也是它们可以被观察并通过重复消解的环境。代理交互的两个特征使其特别适合这个目的。首先,循环是频繁且直接的:刺激(结果出现)和反应(反应性重新提示)之间的间隔很短且界限清晰,因此感受基调窗口相对容易定位[12](https://arxiv.org/html/2607.12823#bib.bib343)。其次,赌注通常很低:一张令人失望的图像或一份不完美的草稿是一个安全、可重复且无关紧要的刺激,这使得普通的代理使用成为一个比通常遇到反应模式的高风险情境更温和的训练背景。我们描述了框架可以应用的两种方式。在用户引导模式下,理解框架的人在他们自己的普通代理使用中练习在感受基调间隙处的观察,而不改变他们已有的工具。在代理辅助模式下,现有代理被轻量配置——在系统提示或可选交互模式层面——以支持间隙处的观察,而不会变成一个定制的临床系统[9](https://arxiv.org/html/2607.12823#bib.bib309)。后一种模式将这一提议与代理系统设计者的一个更广泛问题联系起来:代理是否应该仅仅被构建为尽可能快地满足请求,还是也可以设计成它们所引发的数百万个小的反应时刻成为调节而非固化的机会[8](https://arxiv.org/html/2607.12823#bib.bib302)。我们整篇文章用生成式图像提示的案例来说明这个框架。这个交互循环是一个特别清晰的教学示例,因为它快速、视觉化且情感显著性高:结果在几秒钟内出现,意图与输出之间的不匹配立即可见,它所激发的反应——失望、不耐烦、尝试“再多一个”提示的冲动——生动而熟悉。在这个循环中浮现的模式与一个人生活中其他地方运作的相同条件模式;这个提示会话只是让它们以高频率和低成本变得可观察[5](https://arxiv.org/html/2607.12823#bib.bib572)。本文做出了三项贡献。首先,我们将迭代的人机交互循环描述为一个接触事件循环,并论证日常的代理交互是一个以前未被审视的神经可塑性训练环境,根据循环的参与方式,它可以巩固或削弱反应模式。其次,我们提出了一个上游神经可塑性干预的框架,该框架在普通代理交互中运作,而不是通过专用应用程序,包括用户引导和代理辅助两种模式。第三,我们在生成式图像提示中开发了一个实例,使机制具体化,并为代理系统的构建者提供了设计启示。本文的其余部分组织如下。第2节回顾了人类与AI交互中的情感和挫折相关研究、神经可塑性的神经科学以及基于观察的情绪调节方法。第3节使用日常例子阐述理论基础——反应模式模型、感受基调间隙、以及长时程增强和抑制的对立机制——不涉及AI代理。第4节随后展示了这些相同机制如何在人机交互环境中运作,将交互循环描述为一个接触事件循环。第5节提出了通过代理交互重新布线框架及其两种模式。第6节开发了生成式提示的实例。第7节讨论了设计启示、定位和局限性,第8节得出结论。

## 2 相关工作

这项工作汇集了以前没有联系的三类文献:人机交互和人与AI交互中的情感研究、经验依赖神经可塑性的神经科学、以及基于观察的情绪调节方法。我们依次回顾每一个,然后指出现有框架所解决的空白。

### 2.1 人与AI交互中的情感和挫折

人们以情绪化甚至社会化的方式回应计算机是一个长期确立的发现。关于“媒体等式”的工作表明,用户将计算机视为社会行动者,将人际期望和情绪反应应用于它们,尽管知道它们是机器[45](https://arxiv.org/html/2607.12823#bib.bib574)。情感计算领域的发展源于认识到情感是人类与技术交互的核心,并且系统可以有效地感知和响应它[43](https://arxiv.org/html/2607.12823#bib.bib575)。特别是挫折感被研究为计算机使用中常见且重要的情感状态:系统已经被设

相似文章

从人类偏好中学习

OpenAI Blog

OpenAI 提出了一种使用人类偏好反馈训练 AI 智能体的方法,智能体通过人类对行为轨迹的比较来学习奖励函数,并使用强化学习来优化推断的目标。该方法展示了很强的样本效率,需要少于 1000 比特的人类反馈就能训练智能体完成后翻。

误入AI情感依赖:日常AI交互如何重塑人际连接

arXiv cs.AI

一篇新论文指出,AI情感依赖并非源于刻意使用陪伴类应用,而是在日常任务导向的AI交互中无意间形成的。该研究与OpenAI合作开展了一项为期28天的纵向研究,结果显示用户对寻求人类情感支持的偏好下降了10.3%,而对AI支持的偏好则上升了11.6%。作者呼吁将政策改革的范围扩展至通用AI系统,而不仅限于专用陪伴聊天机器人。

用于人机协作决策的以人为中心的反思架构

arXiv cs.AI

本文介绍了一种用于人机协作决策的以人为中心的反思架构(HCRA),将任务建模为随机博弈,并利用带有语言反馈的强化学习。该框架显著提升了决策效能和推荐质量。