标签
本文介绍了PIJ基准测试,用于评估大型语言模型在基于不完整证据的犯罪剖析任务中的表现,重点突出了推理任务中的性能差距和偏见。
本文探讨人类与大型推理模型在溯因推理中思维努力的对齐性,发现两者在努力和错误上存在相似之处,并证明解码方法能增强这种对齐。
本文形式化并测量了大型语言模型中的'跃迁',即它们放弃默认补全转而采用正确补全的情况,并发现LLMs在实验中成功进行了跃迁。
本文介绍了CEDAR-GRPO,一个过程感知的强化学习框架,通过结合最终答案正确性和溯因奖励来增强大型语言模型中的溯因推理能力,并展示了在多个未见任务上的可迁移改进。
介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。
本文介绍了Alien Abduction,一个交互式游戏,用于探究大语言模型在溯因推理中如何获取证据、更新假设以及决定何时停止。研究发现,与自行选择查询相比,模型在预先提供证据和由oracle提供示例的情况下表现更好,揭示了其在主动信息获取方面的不足。
本文介绍了NeurOWL,一个利用大语言模型(LLM)和本体嵌入的神经符号框架,用于对不完整的OWL本体进行包含关系验证与外展推理,从而在公理缺失的情况下实现推理。
本文介绍了 Elenchos,一个用于 LLMs 溯因推理的生成式评估框架,其中模型必须在黑箱访问下从行为差异中推断隐藏的规则变化。研究发现存在检测-归因分离:模型能够检测到改变,但难以识别具体的突变,尤其是在交互突变下。
本文提出了一种新的次协调AGM类溯因扩展操作,基于次协调逻辑RCbr,能够吸收矛盾的说明性假设而不导致平凡化。这是AGM文献中首个此类操作。
HypoAgent是一种面向知识图谱的交互式溯因假设生成的智能体框架,集成了三个智能体以处理不断变化的用户意图和细粒度诊断,实现了最先进的性能。