abductive-reasoning

标签

Cards List
#abductive-reasoning

逮捕前:基于不完整证据对LLMs进行犯罪剖析基准测试

arXiv cs.CL · 3天前 缓存

本文介绍了PIJ基准测试,用于评估大型语言模型在基于不完整证据的犯罪剖析任务中的表现,重点突出了推理任务中的性能差距和偏见。

0 人收藏 0 人点赞
#abductive-reasoning

人类与推理模型在溯因推理中的思维努力对齐

arXiv cs.CL · 2026-09-03 缓存

本文探讨人类与大型推理模型在溯因推理中思维努力的对齐性,发现两者在努力和错误上存在相似之处,并证明解码方法能增强这种对齐。

0 人收藏 0 人点赞
#abductive-reasoning

当规范补全不正确时:形式化与测量大型语言模型中的跃迁

arXiv cs.CL · 2026-08-28 缓存

本文形式化并测量了大型语言模型中的'跃迁',即它们放弃默认补全转而采用正确补全的情况,并发现LLMs在实验中成功进行了跃迁。

0 人收藏 0 人点赞
#abductive-reasoning

CEDAR-GRPO: 过程感知强化学习用于大型语言模型中的通用溯因推理

arXiv cs.AI · 2026-08-18 缓存

本文介绍了CEDAR-GRPO,一个过程感知的强化学习框架,通过结合最终答案正确性和溯因奖励来增强大型语言模型中的溯因推理能力,并展示了在多个未见任务上的可迁移改进。

0 人收藏 0 人点赞
#abductive-reasoning

MoCA:隐式社会情境分析

arXiv cs.CL · 2026-08-07 缓存

介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。

0 人收藏 0 人点赞
#abductive-reasoning

别让我主动索取:大语言模型在溯因推理的主动多轮信息获取中存在不足

arXiv cs.CL · 2026-08-05 缓存

本文介绍了Alien Abduction,一个交互式游戏,用于探究大语言模型在溯因推理中如何获取证据、更新假设以及决定何时停止。研究发现,与自行选择查询相比,模型在预先提供证据和由oracle提供示例的情况下表现更好,揭示了其在主动信息获取方面的不足。

0 人收藏 0 人点赞
#abductive-reasoning

NeurOWL:一种基于LLM的不完整OWL本体推理的神经符号框架

arXiv cs.AI · 2026-07-20 缓存

本文介绍了NeurOWL,一个利用大语言模型(LLM)和本体嵌入的神经符号框架,用于对不完整的OWL本体进行包含关系验证与外展推理,从而在公理缺失的情况下实现推理。

0 人收藏 0 人点赞
#abductive-reasoning

LLMs 能见烟不见火:基于 Elenchos 的溯因推理评估

arXiv cs.AI · 2026-07-15 缓存

本文介绍了 Elenchos,一个用于 LLMs 溯因推理的生成式评估框架,其中模型必须在黑箱访问下从行为差异中推断隐藏的规则变化。研究发现存在检测-归因分离:模型能够检测到改变,但难以识别具体的突变,尤其是在交互突变下。

0 人收藏 0 人点赞
#abductive-reasoning

AGM类次协调部分交会溯因扩展操作

arXiv cs.AI · 2026-07-14 缓存

本文提出了一种新的次协调AGM类溯因扩展操作,基于次协调逻辑RCbr,能够吸收矛盾的说明性假设而不导致平凡化。这是AGM文献中首个此类操作。

0 人收藏 0 人点赞
#abductive-reasoning

HypoAgent:一种面向知识图谱的交互式溯因假设生成的智能体框架

arXiv cs.AI · 2026-06-01 缓存

HypoAgent是一种面向知识图谱的交互式溯因假设生成的智能体框架,集成了三个智能体以处理不断变化的用户意图和细粒度诊断,实现了最先进的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈