标签
本文提出,人工智能记忆巩固应跨域重组知识(如同梦境),而非单纯重放经验,并证明跨域巩固在神经(LoRA微调)和符号系统中均能提升性能。
本文引入归纳逻辑编程来提取强化学习策略的符号化表示,并提出了新颖的可解释性度量(激活率、特征覆盖度、语法距离和语义距离),用于在单智能体和多智能体设置中进行客观评估。
GATS引入了一种基于图增强的树搜索与分层世界模型(符号型、学习型、生成型),消除了规划过程中的LLM调用,在合成任务和压力测试中实现了100%的成功率,优于LATS和ReAct。
本文提出了一种基于模糊逻辑的新的回答集编程(ASP)扩展,通过隶属函数将数值信息与定性推理相结合,并通过一个旅游推荐案例研究进行了演示。
介绍RusFinChain——首个面向金融领域可验证思维链推理的俄语符号基准测试,涵盖17个领域,包含5,280个参数化示例,并增强了评估指标,包括模糊数值对齐。
RuleChef 是一个框架,利用大型语言模型(LLM)为自然语言处理任务(如文本分类、命名实体识别或关系抽取)生成人类可编辑、可执行的规则。它基于任务描述和一组标注示例生成规则,然后根据更多示例和人类对现有规则的反馈进行迭代改进。RuleChef 还可以通过观察任何现有模型在给定任务上的输入-输出对来引导规则生成。LLM 仅在训练阶段使用,合成规则并根据在留出集上测量的失败进行迭代修补。这个过程最终产生一个快速、确定且可审查的规则系统。初步评估在分类和命名实体识别任务上进行。我们将 RuleChef 作为开源软件发布,采用 Apache 2.0 许可。
本文认为,包括GPT-5在内的数据驱动机器学习系统无法仅通过缩放达到符号级别的逻辑推理,原因在于它们在区分逻辑结构与统计规律方面存在固有局限性。
本文提出了过程验证强化学习,利用 Lean 证明助手作为过程预言机,在训练期间提供细粒度的策略级反馈,从而提升定理证明性能。
本文介绍了RecurrReason,这是一个难度可控的基准测试,包含四个符号逻辑谜题,用于评估序列模型中的多步推理能力。在T5和GPT-2上的微调实验表明,架构比规模更能决定成功,且预训练迁移依赖于局部转移结构。
介绍了PrologMCP,这是一个开源服务器,通过模型上下文协议(MCP)将Prolog暴露为有状态工具,使LLM代理能够将推理委托给符号求解器。评估表明,在前沿推理LLM中,该工具在演绎推理任务上具有竞争力或更高的准确性。
本文提出正交子空间雕刻(OSC),一种新颖的记忆架构,通过将填充物投影到角色基的零空间上,在恒定内存占用下实现深度递归绑定,克服了张量积表示的指数级扩展问题。
MAVEN 是一种轻量级符号推理框架,通过模块化验证和自适应工具编排,提升了智能体工具调用的泛化能力。它在新的压力测试基准 MAVEN-Bench 上取得了显著的准确率提升,并且以极低的成本与专有模型保持竞争力。
本文提出一种符号框架,利用本体、语义分析(AMR)和推理,将脱敏的警方叙述转化为证据关联的事实,从而能够对通常仅存在于自由文本中的事件细节进行结构化查询。
提出了BISON系统,该系统将学习到的低层神经策略与高层符号规划相结合,用于长时域具身任务,展现了强大的泛化能力和效率。
本文介绍了神经规则归纳器(NRI),这是一种用于零样本逻辑规则归纳的基础模型,它利用与领域无关的统计特性,无需重新训练即可跨任务进行泛化。