deliberation

标签

Cards List
#deliberation

BoardroomAI:通过演进决策图实现依赖感知、人类可引导的多智能体审议

arXiv cs.AI · 3天前 缓存

介绍了BoardroomAI,一个通过依赖感知的演进决策图实现人类可引导的多智能体审议框架,能够在人类干预后选择性修复受影响的工件。在合成干预上进行了评估,显示了效率,同时保留了未受影响的节点。

0 人收藏 0 人点赞
#deliberation

通过多方利益相关者协商划定警务AI的风险边界

arXiv cs.AI · 2026-08-07 缓存

一项多方利益相关者研讨会研究,探讨社区代表、警务人员及学者如何针对警务AI使用案例协商风险边界,重点关注种族偏见。研究结果显示,除累犯风险评估外,参与者普遍对采用AI持开放态度,讨论焦点集中于实际效果与公平利益。

0 人收藏 0 人点赞
#deliberation

一百万人,一百万个人工智能代理,三个基础模型。这能构成多元化的审议吗?——又如何衡量?

Reddit r/artificial · 2026-07-22

针对仅用三个基础模型支撑数百万个人工智能代理是否能产生真正多元化的审议进行批判性反思,认为模型间的相关误差可能造成虚假的一致意见,并寻求从集成学习中得出的可操作指标来衡量真正的人类代表性多样性。

0 人收藏 0 人点赞
#deliberation

多元证据,更优预测:信息不对称下的多智能体协商

arXiv cs.AI · 2026-07-03 缓存

本文介绍了InfoDelphi框架,该框架利用信息不对称(将证据划分为共享的公共子集和不相交的私有子集)来改进多智能体LLM的协商与预测。在PolyGym基准测试上,它在Brier得分上比单智能体和多智能体基线提升12-18%,在准确率上提升4-8个百分点,证明了多样化证据是有效多智能体推理的关键。

0 人收藏 0 人点赞
#deliberation

法律中多智能体协商研究

arXiv cs.AI · 2026-07-01 缓存

本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。

0 人收藏 0 人点赞
#deliberation

人类放弃,推理模型坚持:分离难度登记与思考分配

arXiv cs.AI · 2026-06-26 缓存

本文分离了大型推理模型(LRMs)和人类中的难度登记与思考分配,发现LRMs在答错的问题上花费更多token,而人类在失败上花费更少时间,揭示了尽管跨项目难度相关性相似但项目内模式相反。

0 人收藏 0 人点赞
#deliberation

思考标记有助于安全性吗?

Hugging Face Daily Papers · 2026-06-23 缓存

本文研究了推理模型的思考标记是否真正改善了安全对齐,发现安全结果可以从早期的隐藏表示中预测,且推理过程在很大程度上是表面化的,当前的安全干预措施导致了过度拒绝。

0 人收藏 0 人点赞
#deliberation

多智能体LLM商议中的隐藏锚点

arXiv cs.AI · 2026-06-20 缓存

本文把多智能体LLM商议建模成一个闭环动力系统,其中每个智能体都拥有隐藏的内部信念(锚点),该锚点持续牵引其观点。文章展示了如何仅从商议数据中恢复这个锚点,并解释了诸如观点逃逸初始信念凸包等现象。

0 人收藏 0 人点赞
#deliberation

Think-Before-Speak:多智能体社会模拟中从内部评估到公共表达

arXiv cs.AI · 2026-06-03 缓存

介绍了Think-Before-Speak(TBS),一种基于间隔的多智能体模拟框架,将智能体的私人内部评估与公共话语生成分离,从而在社交模拟中分析从内部状态到公共表达的路径。

0 人收藏 0 人点赞
#deliberation

信念引擎:多智能体LLM协商中可配置且可检查的立场动态

arXiv cs.AI · 2026-05-18 缓存

本文介绍了信念引擎(Belief Engine),这是一种为LLM智能体设计的可审计信念更新层,通过将信念视为具有显式更新规则的证据状态,使得多智能体协商中的立场变化变得可配置且可检查。

0 人收藏 0 人点赞
#deliberation

CIG:通过语义记忆动态测量审议对话中的会话信息增益

arXiv cs.CL · 2026-04-20 缓存

本文介绍了会话信息增益(CIG)框架,用于通过跟踪不断演变的语义记忆来衡量发言如何推进审议对话中的集体理解,并根据新颖性、相关性和蕴含范围对发言进行评分。作者证明了基于记忆的动态与人类感知的对话质量相关性强于传统启发式方法,并开发了基于LLM的信息中心会话分析预测器。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈