compositional-reasoning

标签

Cards List
#compositional-reasoning

基于强化学习后训练的语言模型组合推理

arXiv cs.AI · 18小时前 缓存

本文提出一个依赖图框架以形式化语言模型中的组合推理,并评估强化学习后训练的影响,发现了一种不对称性:组合技能训练向分解任务的迁移比反向更为容易。

0 人收藏 0 人点赞
#compositional-reasoning

用于组合性与可解释认知推理的多阶段规则链式框架

arXiv cs.AI · 6天前 缓存

本文提出了一种用于在抽象与推理语料库(ARC)基准测试上进行组合性和可解释认知推理的多阶段规则链式框架,通过集成确定性求解器和层级抽象,实现了超过95%的准确率。

0 人收藏 0 人点赞
#compositional-reasoning

CORE: 通过重排序器蒸馏改进MLLM嵌入中的组合推理

Hugging Face Daily Papers · 2026-09-03 缓存

CORE引入一种蒸馏方法,通过Rank-KL目标将组合排序判断从重排序器传输到嵌入模型,从而增强跨基准的组合检索性能,同时不损害标准任务。

0 人收藏 0 人点赞
#compositional-reasoning

循环语言模型提升组合式工具调用能力

arXiv cs.AI · 2026-08-20 缓存

本文探讨了循环语言模型如何利用迭代潜在计算提升代理系统中的组合式工具调用,展示了对多步骤API交互的益处。

0 人收藏 0 人点赞
#compositional-reasoning

从原子证据到逻辑组合:复合答案选项的结构化组合推理

Hugging Face Daily Papers · 2026-08-13 缓存

本文引入了一个框架,将复合逻辑答案选项分解为原子判断,并使用受算子约束的整数线性规划来改进大语言模型在 AND、OR 以及 NEITHER/NOR 算子上的推理能力。该框架在 LOGICAL-COMMONSENSEQA 和新的基准 LOGICAL-SATA 上取得了显著的 F1 提升。

0 人收藏 0 人点赞
#compositional-reasoning

MEGA:基于智慧图的自进化智能体优化基础设施

arXiv cs.AI · 2026-08-12 缓存

MEGA是一种自进化的基础设施,用于编码智能体优化,它从会话中提炼可复用的智慧,通过类型化智慧图对其进行组合,并利用运行证据持续改进智能体以及指导其优化的知识。

0 人收藏 0 人点赞
#compositional-reasoning

RECON:面向长上下文组合推理的智能体记忆基准测试

arXiv cs.AI · 2026-07-21 缓存

介绍RECON,一个用于评估基于LLM的智能体在长上下文中组合推理能力的基准测试,涵盖刑事、医疗和金融领域的24个案例文件。最佳非Oracle系统仅达到22.4%的准确率,揭示了当前记忆架构的严重局限性。

0 人收藏 0 人点赞
#compositional-reasoning

RL后训练构建组合推理策略

arXiv cs.CL · 2026-07-09 缓存

本文研究强化学习后训练是否能够将原始技能组合成更高层次的组合策略,使用一个完全可观测的重写语法环境。作者发现,RL通过分阶段的组合机制重新组织原始能力,而拒绝微调则因产生大量无效的捷径式重写而停滞不前。

0 人收藏 0 人点赞
#compositional-reasoning

CDR-Bench:评估组合性、顺序敏感数据精炼指令的忠实执行能力

arXiv cs.AI · 2026-07-01 缓存

介绍CDR-Bench,一个包含3,462个任务的基准,用于评估LLM忠实执行组合性、顺序敏感数据精炼指令的能力。在10多个LLM上的实验表明,在组合性和顺序敏感的设置中性能显著下降,凸显了缺乏执行流程的忠实性。

0 人收藏 0 人点赞
#compositional-reasoning

全息记忆用于知识图谱中的零样本组合推理:失败位置与原因的机制研究

arXiv cs.LG · 2026-06-25 缓存

本文研究了全息约简表示在知识图谱中零样本组合推理的应用,发现虽然单跳性能强劲,但组合推理仍因叠加记忆中的检索容量和干扰效应而失败,而非绑定-解绑代数的问题。

0 人收藏 0 人点赞
#compositional-reasoning

R-APS:通过反思性对抗帕累托搜索实现约束设计的组合推理与上下文元学习

arXiv cs.AI · 2026-06-04 缓存

R-APS(反思性对抗帕累托搜索)是一种面向约束设计任务的新方法,通过跨三个时间尺度的推理模式分解,解决了基于LLM的智能体系统中的三类结构性缺陷——错误传播、鲁棒性评估与知识失效,且无需微调。在平面机构综合任务上的评估结果表明,与基线方法相比,R-APS实现了3.5倍更紧的鲁棒性证书、46%更快的首次准入迭代速度,以及2.1倍的Chamfer距离缩减。

0 人收藏 0 人点赞
#compositional-reasoning

MAVEN:提升智能体工具调用的泛化能力

arXiv cs.AI · 2026-06-01 缓存

MAVEN 是一种轻量级符号推理框架,通过模块化验证和自适应工具编排,提升了智能体工具调用的泛化能力。它在新的压力测试基准 MAVEN-Bench 上取得了显著的准确率提升,并且以极低的成本与专有模型保持竞争力。

0 人收藏 0 人点赞
#compositional-reasoning

组合坍缩:稳定的事实知识并不蕴含组合推理

arXiv cs.AI · 2026-05-27 缓存

本文介绍了'组合坍缩'这一现象,即语言模型虽然拥有稳定的事实知识,但仍无法将这些知识组合成正确的多跳推理,并提出了一个双门协议,以将组合失败与原子知识不稳定性分离开来。

0 人收藏 0 人点赞
#compositional-reasoning

Transformer模型学习中产生的捷径策略损害其持续组合推理能力

arXiv cs.LG · 2026-05-08 缓存

本研究论文探讨了Transformer模型(特别是BERT)在学习过程中产生的捷径策略如何削弱其持续组合推理能力。研究将BERT与ALBERT进行对比,发现ALBERT的循环特性为持续学习任务提供了更好的归纳偏置。

0 人收藏 0 人点赞
#compositional-reasoning

奇妙智能体竞赛:强大的工具使用者,薄弱的导航者

arXiv cs.CL · 2026-04-20 缓存

奇妙智能体竞赛(AAR)推出了一个新的基准测试,包含1,400个有向无环图(DAG)谜题实例,用于评估LLM智能体在分叉-合并工具链和维基百科导航中的表现。评估结果显示,智能体在工具使用方面表现出色(错误率<17%),但在导航方面苦苦挣扎(27-52%的失败率),暴露了现有线性基准测试无法发现的关键差距。

0 人收藏 0 人点赞
#compositional-reasoning

Concrete Jungle:利用词汇具体性铺路,革新对比负样本挖掘以提升组合理解

Hugging Face Daily Papers · 2026-04-14 缓存

提出 Slipform 训练框架,借助词汇具体性筛选更困难的负样本,并引入基于边界的 Cement 损失,显著提升视觉-语言模型的组合推理能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈