标签
本文提出一个依赖图框架以形式化语言模型中的组合推理,并评估强化学习后训练的影响,发现了一种不对称性:组合技能训练向分解任务的迁移比反向更为容易。
本文提出了一种用于在抽象与推理语料库(ARC)基准测试上进行组合性和可解释认知推理的多阶段规则链式框架,通过集成确定性求解器和层级抽象,实现了超过95%的准确率。
CORE引入一种蒸馏方法,通过Rank-KL目标将组合排序判断从重排序器传输到嵌入模型,从而增强跨基准的组合检索性能,同时不损害标准任务。
本文探讨了循环语言模型如何利用迭代潜在计算提升代理系统中的组合式工具调用,展示了对多步骤API交互的益处。
本文引入了一个框架,将复合逻辑答案选项分解为原子判断,并使用受算子约束的整数线性规划来改进大语言模型在 AND、OR 以及 NEITHER/NOR 算子上的推理能力。该框架在 LOGICAL-COMMONSENSEQA 和新的基准 LOGICAL-SATA 上取得了显著的 F1 提升。
MEGA是一种自进化的基础设施,用于编码智能体优化,它从会话中提炼可复用的智慧,通过类型化智慧图对其进行组合,并利用运行证据持续改进智能体以及指导其优化的知识。
介绍RECON,一个用于评估基于LLM的智能体在长上下文中组合推理能力的基准测试,涵盖刑事、医疗和金融领域的24个案例文件。最佳非Oracle系统仅达到22.4%的准确率,揭示了当前记忆架构的严重局限性。
本文研究强化学习后训练是否能够将原始技能组合成更高层次的组合策略,使用一个完全可观测的重写语法环境。作者发现,RL通过分阶段的组合机制重新组织原始能力,而拒绝微调则因产生大量无效的捷径式重写而停滞不前。
介绍CDR-Bench,一个包含3,462个任务的基准,用于评估LLM忠实执行组合性、顺序敏感数据精炼指令的能力。在10多个LLM上的实验表明,在组合性和顺序敏感的设置中性能显著下降,凸显了缺乏执行流程的忠实性。
本文研究了全息约简表示在知识图谱中零样本组合推理的应用,发现虽然单跳性能强劲,但组合推理仍因叠加记忆中的检索容量和干扰效应而失败,而非绑定-解绑代数的问题。
R-APS(反思性对抗帕累托搜索)是一种面向约束设计任务的新方法,通过跨三个时间尺度的推理模式分解,解决了基于LLM的智能体系统中的三类结构性缺陷——错误传播、鲁棒性评估与知识失效,且无需微调。在平面机构综合任务上的评估结果表明,与基线方法相比,R-APS实现了3.5倍更紧的鲁棒性证书、46%更快的首次准入迭代速度,以及2.1倍的Chamfer距离缩减。
MAVEN 是一种轻量级符号推理框架,通过模块化验证和自适应工具编排,提升了智能体工具调用的泛化能力。它在新的压力测试基准 MAVEN-Bench 上取得了显著的准确率提升,并且以极低的成本与专有模型保持竞争力。
本文介绍了'组合坍缩'这一现象,即语言模型虽然拥有稳定的事实知识,但仍无法将这些知识组合成正确的多跳推理,并提出了一个双门协议,以将组合失败与原子知识不稳定性分离开来。
本研究论文探讨了Transformer模型(特别是BERT)在学习过程中产生的捷径策略如何削弱其持续组合推理能力。研究将BERT与ALBERT进行对比,发现ALBERT的循环特性为持续学习任务提供了更好的归纳偏置。
奇妙智能体竞赛(AAR)推出了一个新的基准测试,包含1,400个有向无环图(DAG)谜题实例,用于评估LLM智能体在分叉-合并工具链和维基百科导航中的表现。评估结果显示,智能体在工具使用方面表现出色(错误率<17%),但在导航方面苦苦挣扎(27-52%的失败率),暴露了现有线性基准测试无法发现的关键差距。
提出 Slipform 训练框架,借助词汇具体性筛选更困难的负样本,并引入基于边界的 Cement 损失,显著提升视觉-语言模型的组合推理能力。