标签
本文探讨了治理多个AI智能体交互的挑战,强调了个别批准的智能体可能以意想不到的方式发生冲突,并提出了组织如何应对此类智能体间治理的问题。
GVD 引入了一个用于文档仓库中受控版本管理与去重的统一框架,通过使用双向规则对齐和冲突解决策略,结合本地编码器模型,在企业数据上实现高性能。
本文形式化了可变RAG中的语义遮蔽,并引入了GC-Mem,一种基于时间优势的协议,用于解决冲突并恢复超过90%的准确性。
论文引入ConflictGUI,一个用于GUI代理冲突感知终止的基准,并提出ConflictGuard,一个推理时框架,旨在减少过度服从行为并提升在冲突指令下的性能。
CoVer是一个事实裁决框架,用于处理声明验证中的证据层面和聚合层面冲突,在X社区笔记系统的ContraNote数据集上评估表现出色。
本文介绍了一个基准测试,用于研究大型语言模型如何仲裁来自文本和数字来源的冲突证据,发现模型使用启发式策略,并偏向于近期性和外部工具。
本文研究视觉语言模型在图像或文本模态退化时如何调整对两者依赖的机制,揭示了任务依赖性行为,并引入了一个新的冲突基准用于评估。
本文介绍了TANGLE,一个用于评估LLM代理在个人记忆中不可还原冲突下认知行为的基准,评估维度包括冲突感知和记忆忠实度。
介绍了SWE-Touch,一个基准测试框架,它在智能体编码轨迹中注入与用户冲突的编辑,结果表明,尽管当前编码智能体在独立基准测试中表现强劲,但在协作场景中性能显著下降。
本文提出了一种基于深度Q网络的多智能体强化学习框架,用于在降级监视条件下运行的异构小型无人机和电动垂直起降飞机之间进行分散式冲突解决,并在90种交通密度和间隔阈值组合中评估策略。
FlowEdit 是一个新颖的框架,利用信息论原理来调节LLMs的内部推理流,使其能够针对具有冲突条件的不适定问题在单次生成中输出多个替代回答。实验表明,与领先的专有模型相比,精确集合匹配准确率提升68%,回答信息量提升24%。
StateFuse是一种面向多智能体系统的冲突感知复制内存契约,它保留矛盾的观察结果而非将其合并,从而在不追求通用准确性提升的前提下,实现更安全的弃权和可审计的修正。
本文探讨将非暴力沟通(NVC)原则作为轻量级提示约束,用于减少大语言模型在冲突倾向交互中的对话升级。在多个指令微调模型上的实验表明,NVC约束提示能持续降低对话升级,并稳定与高度抵抗用户的互动。
SoCRATES提出了一个真实的多领域基准,用于评估主动式LLM调解器,显示顶尖模型在冲突解决中仅能弥合约三分之一的共识差距。