DAR:基于智能体框架的道义推理

Hugging Face Daily Papers 论文

摘要

本文介绍了DAR(Deontic Agentic Reasoning),一个智能体框架,使LLM能够交互式地查询法律法规和政策,用于法律/监管推理任务。在DeonticBench上评估的结果表明,智能体引导可以提升前沿模型,但可能会导致较弱模型在数值任务上表现下降,同时消耗更多令牌。

道义推理是通过将明确的规则和政策应用于具体案例事实来回答问题的任务,例如根据法规计算税务责任或确定移民上诉的结果。基于LLM的道义推理的一个关键技术挑战是,相关的规则集可能很长且相互引用,因此模型可能仍然无法定位特定推理步骤所需的规则。我们引入了道义智能体推理(DAR),这是一种智能体推理设置,其中模型可以按需与法规进行交互。我们在DeonticBench的困难子集上使用多种引导方式评估了DAR。在这些设置中,我们发现智能体引导可以推动道义推理任务的前沿,但改进并不均匀:较弱的模型通常在数值任务上表现下降,同时消耗更多的令牌。
查看原文

相似文章

最好的智能代理工具会这样做……

Reddit r/AI_Agents

作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。

自适应潜在智能体推理

arXiv cs.CL

本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。

代理型AI系统运行时治理的道义政策

arXiv cs.AI

本文提出了AgenticRei框架,该框架使用OWL表达的道义政策对由LLM驱动的代理型AI系统进行运行时治理,实现了义务、豁免和冲突解决,超越了传统策略引擎。

L-MAD:法律推理中多智能体辩论结构的系统性评估

arXiv cs.AI

本文介绍了L-MAD,一个用于系统性评估法律文本蕴含中多智能体辩论结构的框架。研究发现,增加智能体数量可提升准确率,但延长辩论轮次会导致有害的过度 deliberation 漂移,使得智能体互相强化错误,相较于单智能体基线最高提升8%。