标签
介绍了SWE-Touch,一个基准测试框架,它在智能体编码轨迹中注入与用户冲突的编辑,结果表明,尽管当前编码智能体在独立基准测试中表现强劲,但在协作场景中性能显著下降。
本文提出了一种基于深度Q网络的多智能体强化学习框架,用于在降级监视条件下运行的异构小型无人机和电动垂直起降飞机之间进行分散式冲突解决,并在90种交通密度和间隔阈值组合中评估策略。
FlowEdit 是一个新颖的框架,利用信息论原理来调节LLMs的内部推理流,使其能够针对具有冲突条件的不适定问题在单次生成中输出多个替代回答。实验表明,与领先的专有模型相比,精确集合匹配准确率提升68%,回答信息量提升24%。
StateFuse是一种面向多智能体系统的冲突感知复制内存契约,它保留矛盾的观察结果而非将其合并,从而在不追求通用准确性提升的前提下,实现更安全的弃权和可审计的修正。
本文探讨将非暴力沟通(NVC)原则作为轻量级提示约束,用于减少大语言模型在冲突倾向交互中的对话升级。在多个指令微调模型上的实验表明,NVC约束提示能持续降低对话升级,并稳定与高度抵抗用户的互动。
SoCRATES提出了一个真实的多领域基准,用于评估主动式LLM调解器,显示顶尖模型在冲突解决中仅能弥合约三分之一的共识差距。