induction

标签

Cards List
#induction

SciR:用于LLMs科学推理的可控基准

arXiv cs.AI · 2026-06-12 缓存

SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。

0 人收藏 0 人点赞
#induction

从智能体轨迹中诱导推理原语

arXiv cs.AI · 2026-06-03 缓存

介绍推理原语诱导(Reasoning Primitive Induction)方法,该方法从成功的ReAct轨迹中挖掘,将重复出现的推理动作聚类为类型化的伪工具,在基准测试上比原始智能体高出数十个百分点。

0 人收藏 0 人点赞
#induction

按我说的做,不是按我做的做:LLM中的指令-归纳冲突

arXiv cs.CL · 2026-05-21 缓存

本文研究了LLM中指令遵循与模式补全之间的冲突,发现指令遵循在归纳压力下较为脆弱,且在不同模型间差异显著,而输出多样性是鲁棒性的主要因素。

0 人收藏 0 人点赞
#induction

科学理解中的幻觉

Hacker News Top · 2026-05-14 缓存

本文探讨了科学实践中理解幻觉的概念,讨论了模糊语言、不完整的因果解释以及令人满意但不完整的解释如何导致科学家忽视更深层次的理解。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈