用于人机协作决策的以人为中心的反思架构
摘要
本文介绍了一种用于人机协作决策的以人为中心的反思架构(HCRA),将任务建模为随机博弈,并利用带有语言反馈的强化学习。该框架显著提升了决策效能和推荐质量。
arXiv:2607.03025v1 公告类型: 新
摘要: 大型语言模型(LLMs)在人类活动的各个领域(从日常任务到安全关键应用)中的应用,旨在以最少的人类反馈提升决策效能。同时,它寻求使决策与人类期望、偏好和需求保持一致,同时减轻与AI非确定性相关的风险。然而,人类常常过度或不足地依赖AI推荐,而当前的AI系统对人类期望的校准仍不充分。为解决这些挑战,我们提出了一种人机协作决策框架,旨在增强人类能力,并使AI智能体与人类偏好和期望保持一致。具体而言,本文(a)将协作决策任务建模为AI智能体与人类玩家之间的随机博弈,(b)提出了以人为中心的反思架构(HCRA),该架构将人类校准模型与利用语言反馈进行迭代反思过程的强化学习智能体相结合。评估结果表明,HCRA提升了决策效能,并提供了高质量的推荐。
查看缓存全文
缓存时间: 2026/07/07 04:34
# 以人为中心的反思架构:人机协作决策 来源:https://arxiv.org/html/2607.03025 \(2009年6月5日\) ###### 摘要\. 大语言模型(LLM)在人类活动的各个领域——从日常任务到安全关键应用——的应用,旨在以最少的人类反馈提升决策有效性。同时,它也力图使决策符合人类的期望、偏好与需求,并降低与AI非确定性相关的风险。然而,人类往往过度或不足依赖AI建议,而当前的AI系统也难以与人类期望充分对齐。为应对这些挑战,我们提出了一种人机协作决策框架,旨在增强人类能力,并使AI代理与人类偏好和期望对齐。具体而言,本文(a)将协作决策任务形式化为AI代理与人类玩家之间的随机博弈,(b)提出了以人为中心的反思架构(HCRA),该架构将人类校准模型与强化学习代理相结合,在迭代反思过程中利用语言反馈。评估结果表明,HCRA显著提升了决策有效性,并提供了高质量建议。 智能代理AI,以人为中心的AI,协作决策,大语言模型,语言代理,强化学习,对齐 ††copyright:acmlicensed††journalyear:2018††doi:XXXXXXX\.XXXXXXX††conference:第14届EETN人工智能会议;2026年9月09–11日;希腊干尼亚††isbn:978\-1\-4503\-XXXX\-X/2018/06††ccs:计算方法 随机博弈††ccs:计算方法 从批评中学习††ccs:计算方法 强化学习††ccs:信息系统 决策支持系统## 1\.引言 在许多协作决策环境中,人类与AI代理会形成交互式反馈循环。这一迭代过程旨在:(a)引导代理提出人类可接受的建议,(b)让用户能够表达并细化自己的偏好与期望,(c)使代理能够从历史交互中学习。这种紧密交互在人类必须保留最终决策权的高风险领域(例如,\(Beedeet al\.,2020 (https://arxiv.org/html/2607.03025#bib.bib1)\),\(Fischer\-Abaigaret al\.,2024 (https://arxiv.org/html/2607.03025#bib.bib8)\))至关重要。然而,有效的人机协作仍是一大挑战。在与AI合作时,人类表现往往低于预期\(Liuet al\.,2021 (https://arxiv.org/html/2607.03025#bib.bib6)\)。虽然AI解释可以影响用户决策\(Li and Yin,2025 (https://arxiv.org/html/2607.03025#bib.bib13)\),但它们常常无法提升系统理解或适当校准信任\(Liuet al\.,2021 (https://arxiv.org/html/2607.03025#bib.bib6)\)\(Buçincaet al\.,2020 (https://arxiv.org/html/2607.03025#bib.bib2)\)\(Bansalet al\.,2021b (https://arxiv.org/html/2607.03025#bib.bib3)\)\(Zhanget al\.,2020 (https://arxiv.org/html/2607.03025#bib.bib4)\)\(Wang and Yin,2021 (https://arxiv.org/html/2607.03025#bib.bib5)\)\(Vasconceloset al\.,2022 (https://arxiv.org/html/2607.03025#bib.bib7)\)。当用户必须将有限的认知带宽投入于时间敏感、后果严重的问题时,这一不足尤为关键\(Papadopouloset al\.,2024 (https://arxiv.org/html/2607.03025#bib.bib29)\)。此外,高建议准确性本身不足以建立信任;有效的协作要求AI系统在核心任务目标之外,同时优化人类效用\(Bansalet al\.,2021a (https://arxiv.org/html/2607.03025#bib.bib14)\),\(Vodrahalliet al\.,2022b (https://arxiv.org/html/2607.03025#bib.bib10)\)。 本文聚焦于基于LLM的代理,其动机源于两个核心局限。第一,人类对AI能力的不校准期望常引发过度或不足依赖\(Bansalet al\.,2019 (https://arxiv.org/html/2607.03025#bib.bib15)\)\(Zhang,2023 (https://arxiv.org/html/2607.03025#bib.bib16)\)\(Boet al\.,2025 (https://arxiv.org/html/2607.03025#bib.bib17)\)。第二,我们不单纯依赖大规模训练后聚合对齐(如RLHF\(Ziegleret al\.,2020 (https://arxiv.org/html/2607.03025#bib.bib11)\)\(Ouyanget al\.,2022 (https://arxiv.org/html/2607.03025#bib.bib12)\)),而是利用测试时缩放\(Snellet al\.,2024 (https://arxiv.org/html/2607.03025#bib.bib18)\)\(Jaech and et al\.,2024 (https://arxiv.org/html/2607.03025#bib.bib19)\)与上下文测试时调整。这种方法建立了一种以人为中心的工作流程,使高质量决策能在上下文中根据用户效用产生,允许代理动态优化建议质量,并缓解LLM非确定性带来的问题。 为解决这些问题,我们提出了一种以人为中心的反思架构(HCRA),用于协作决策。该架构将强化学习(RL)语言代理与人类校准模型\(Vodrahalliet al\.,2022b (https://arxiv.org/html/2607.03025#bib.bib10)\)相结合,在迭代反思过程中运行\(Xuet al\.,2025 (https://arxiv.org/html/2607.03025#bib.bib20)\)111数据集与代码可在https://github.com/AILabDsUnipi/HCRA获取。 本文做出以下贡献: - **博弈论形式化**:我们将协作决策过程建模为AI代理与人类之间的随机博弈。在该框架中,我们定义了针对用户期望与偏好优化的人类效用。该效用最大化准则为迭代决策过程提供了形式化的收敛与终止保证。 - **架构设计**:我们提出了HCRA,一个通过迭代反思优化人机协作的框架。HCRA在测试时通过利用历史交互、AI建议校准模型及人类接受模型来调整AI建议。 - **实证评估**:我们以旅游推荐领域(在该领域,不准确可能带来现实世界后果)验证了HCRA222例如,参见https://www.webpronews.com/ai-hallucinations-in-travel-apps-lead-to-fake-landmarks-and-dangers/。我们的结果展示了该框架的有效性与建议质量,突显了人类行为建模与以人为中心的目标函数的关键作用。 ## 2\.相关工作 本文致力于AI辅助决策这一日益重要且不断增长的研究方向\(Laiet al\.,2023 (https://arxiv.org/html/2607.03025#bib.bib9)\)。其中最基本的范式是AI代理扮演辅助角色,提供人类可接受或拒绝的建议。一个关键挑战是:我们能否实现超越人类或AI单独表现的人机协作,通过有效的决策过程贡献高质量建议?为应对这一挑战,近期若干研究提出了不同设计,帮助人类基于置信度分数对AI分配适当信任。实证结果表明,人类的自我置信度校准不佳,无法可靠地反映良好校准的置信度分数。这激发了\(Bansalet al\.,2021a (https://arxiv.org/html/2607.03025#bib.bib14)\)、\(Maet al\.,2023 (https://arxiv.org/html/2607.03025#bib.bib21)\)与\(Vodrahalliet al\.,2022b (https://arxiv.org/html/2607.03025#bib.bib10)\)中的研究问题,强调了AI建议置信度对人类决策的重要性。这些研究与塑造人类自我置信度以进行AI辅助决策(例如\(Takayanagiet al\.,2025 (https://arxiv.org/html/2607.03025#bib.bib23)\))的方法形成对比。\(Maet al\.,2023 (https://arxiv.org/html/2607.03025#bib.bib21)\)的作者试图通过提出一个同时考虑人类与AI良好校准置信度的框架来回答这一问题。然而,\(Vodrahalliet al\.,2022b (https://arxiv.org/html/2607.03025#bib.bib10)\)提出的框架强调,通过利用人类行为模型修改AI建议的置信度可以增强人机协作:作者建议优化AI建议置信度的变换,使变换后的置信度分数与人类对AI置信度分数的感知相匹配。通过这种方式,他们针对人类用户优化AI系统,实现了以人为校准的AI。此外,\(Benz and Rodriguez,2024 (https://arxiv.org/html/2607.03025#bib.bib22)\)的作者遵循更基础的方法,证明如果(人类)决策者的置信度值相对于其自身预测的置信度(人类对齐)满足某种自然对齐属性,那么决策者可以做出最优决策。 基于这些结果,本文针对人类行为模型优化AI语言代理。与\(Vodrahalliet al\.,2022b (https://arxiv.org/html/2607.03025#bib.bib10)\)不同,我们假设人类对真正的建议可能是什么没有任何信息(并且不一定有初始猜测),但人类可能有某些最终决策必须满足的要求。此外,与单步决策任务不同,我们形式化并实现了一个迭代反思协作过程,该过程透明地、无需人类干预,旨在最大化人类效用。反思过程受到Reflexion\(Shinnet al\.,2023 (https://arxiv.org/html/2607.03025#bib.bib26)\)的启发:它代表了语言代理RL中的一种新范式,无需梯度优化方法。Reflexion使代理能够通过试错利用语言反馈进行学习,而非参数更新,无需昂贵的模型微调。Reflexion被形式化为迭代优化过程。如\(Shinnet al\.,2023 (https://arxiv.org/html/2607.03025#bib.bib26)\)所述,在反思过程的任何迭代tt中,一个行动者通过与环境交互生成轨迹τt\\tau\_\{t\}以解决顺序任务。一个评估器模型生成标量奖励信号rt,该信号随任务特定性能提升而提高。为了将rt放大为可用于LLM改进的反馈形式,自我反思模型分析集合{ (τi,ri\\tau\_\{i\},r\_\{i\}),i=1,...,t },生成摘要srtsr\_\{t\},并存储于记忆缓冲中。行动者、评估器与自我反思模型通过迭代协同工作,直至评估器认为第t次迭代的最终轨迹τT\\tau\_\{T\}正确。Reflexion的记忆组件——短期记忆用于轨迹历史,长期记忆用于持久知识库以指导未来决策——对其有效性至关重要。Reflexion的关键创新在于将轨迹上的稀疏奖励转化为语言反馈信号。Reflexion的语言反思提供了对失败模式的具体洞察,并在迭代过程中建议针对性的修正措施。如\(Shinnet al\.,2023 (https://arxiv.org/html/2607.03025#bib.bib26)\)所示,这种试错、自我反思与持久记忆的迭代过程使代理能够通过解决建议缺陷来提升决策能力并促进学习。 为了追求以人为中心的决策过程,我们将经过良好训练的人预测模型集成到代理的反思循环中。这些模型将建议选择引向以人为中心的目标,旨在最大化期望的人类效用,并决定反思迭代过程的终止条件。这些模型基于从真实用户收集的经验数据训练,能够准确模拟人类的接受行为。通过用模拟交互替代真实世界响应,这种方法使系统能够在不要求每一步都进行持续人工反馈的情况下评估决策。此外,我们考虑简单的单步决策任务,而非顺序任务。 ## 3\.问题形式化 迭代反思决策过程被形式化为AI与人类之间的随机博弈:在任何迭代(时间步)tt,过程处于状态sts\_\{t\},玩家根据决策过程要求选择动作。他们获得收益,过程进入下一次迭代。形式上,迭代反思决策随机过程包含以下组成部分: - **SS**: 一组游戏(状态)。st∈Ss\_\{t\}\\in S被指定为如下形式,其中 1. (1) QrtQr\_\{t\}是tt时刻的请求,由人类指定的初始请求Qr0Qr\_\{0\}构成,并在后续迭代中增强。 2. (2) CsCss是一组应被代理建议满足的人类偏好或约束。我们可能区分偏好(也称软约束)与硬约束,尽管之后我们将它们统称为“约束”。约束以自然语言表达,但可以形式化为 (attrattropopvaluevalue),其中attrattr是真实世界领域特定属性(例如任务完成时间、持续时间、资源数量、风格/技能),opop可以是 {=,≤,≥,>,<}\\\{=,\\leq,\\geq,\>,<\\\} 中的任意运算符,或任何领域特定的关系规范,valuevalue是attrattr的数值或分类值(例如 criminalitycriminality inareaarea isis veryvery lowlow,menu\_price<100menu\\\_price<100 Euros)。 3. (3) (Ret,cft)(Re\_\{t\},cf\_\{t\})是时间步tt的AI建议,包含建议内容RetRe\_\{t\}与代理评估的置信度cftcf\_\{t\}。 4. (4) gtg\_\{t\}是建议的人类校准置信度,将展示给人类。实际上,gtg\_\{t\}是对cftcf\_\{t\}的变换,以符合人类对AI建议的校准期望(后续解释)。 约束CsCss必须由AI建议RetRe\_\{t\}满足。若没有任何违反,我们称这种情况为“一致”。 - **NN**: 这是玩家集合,包括人类(记作hh),此处由人类模型表示,以及AI代理(记作agag)。虽然agag能完全访问状态s∈Ss\\in S的组成部分,但假设人类在每个时间步tt观察到建议RetRe\_\{t\}和建议的人类校准置信度gtg\_\{t\}。 - **动作集合**: A=Ah×AagA=A^\{h\}\\times A^\{ag\},其中AiA^\{i\}是玩家 i∈{h,ag}i\\in\\\{h,ag\\\} 可用的动作集合。具体而言,AhA^\{h\}中的动作atha^\{h\}\_\{t\}位于 [0,1][0,1] 中,表示人类在该状态下接受建议的概率。由于人类由人类行为模型表示,atha^\{h\}\_\{t\}是时间步tt人类接受建议的预测概率,由函数 hacc:S→[0,1]h\_\{acc\}:S\\rightarrow[0,1] 提供。动作ataga^\{ag\}\_\{t\}位于 Aag={Reflective\_text(st)|st∈S,t=0,1,2...}A^\{ag\}=\\\{Reflective\\\_text\(s\_\{t\}\)\|s\_\{t\}\\in S,t=0,1,2\.\.\.\\\},这是可在任何时间步tt作为语言反馈提供的反思文本集合。 - **P:S×A×S→[0,1]P:S\\times A\\times S\\rightarrow[0,1]**:从状态sts\_\{t\}到状态st\+1s\_\{t\+1\}的状态转移函数,在联合玩家动作 at=(ath,atag)∈Aa\_\{t\}=\(a\_\{t\}^\{h\},a\_\{t\}^\{ag\}\)\\in A 执行之后触发。 -相似文章
超越“人工智能协助人类”:智能体时代人机团队决策导向的评估设计
本文提出TEAM-Design,一种预算规则,用于分配重放任务以评估人机工作流相对于纯人类或纯智能体替代方案的有效性,应用于临床和编码环境。
从消费到反思:设计人机关系以实现稳定推理
本文引入了关系反思智能(RRI),这是一个推理时治理层,通过可审计的推理循环来稳定人机推理,解决了人类和大语言模型共有的认知弱点。
BoardroomAI:通过演进决策图实现依赖感知、人类可引导的多智能体审议
介绍了BoardroomAI,一个通过依赖感知的演进决策图实现人类可引导的多智能体审议框架,能够在人类干预后选择性修复受影响的工件。在合成干预上进行了评估,显示了效率,同时保留了未受影响的节点。
在人机对齐下借助AI辅助决策的学习
本文研究了在人机对齐条件下学习借助AI做出最优决策的问题,表明对齐可以降低学习的复杂度,并给出了遗憾界。
人机智能体交互:一种神经可塑性训练环境
本文提出,人类与AI智能体之间的迭代循环(请求、回应、评估、修正)是一个高频的神经可塑性训练环境,其重复性会强化负面心理模式,并指出这一机制可用于有益的认知训练。