multi-step-reasoning

标签

Cards List
#multi-step-reasoning

@emanuel_build: 如果你对深入探索AI Agents感兴趣,斯坦福大学已将CS329A课程:Self-Improving AI Agents开放…

X AI KOLs Timeline · 2026-08-23 缓存

斯坦福大学已将CS329A课程关于Self-Improving AI Agents的讲座免费开放在YouTube上,涵盖AI智能体、Constitutional AI和多步推理等主题。

0 人收藏 0 人点赞
#multi-step-reasoning

@lateinteraction:我对如今所谓的“LLM harnesses”的看法始于2019年底,当时@ChrisGPotts推荐我……

X AI KOLs Timeline · 2026-08-07 缓存

关于LLM harnesses的一种观点,追溯其起源至早期多步骤工具使用研究(如HotPotQA和GoldEn),并包含Christopher Potts对“仅靠LLM是否足够”这一争论的评论。

0 人收藏 0 人点赞
#multi-step-reasoning

层次化去噪用于多步视觉推理

Hugging Face Daily Papers · 2026-07-16 缓存

HDR 是一个统一框架,将层次化潜变量集成到因果视频生成中,用于多步视觉推理。与基线方法相比,它实现了更好的推理一致性、更低的延迟和强大的数据效率。

0 人收藏 0 人点赞
#multi-step-reasoning

@ando_w: https://x.com/ando_w/status/2075468963098546520

X AI KOLs Timeline · 2026-07-10 缓存

本文介绍如何将单轮RAG升级为Agentic RAG,通过让LLM自主决定多次检索和调用工具,解决复合问题的多步推理。提供了基于Qwen3.7-Max的代码示例和实现思路。

0 人收藏 0 人点赞
#multi-step-reasoning

搜索代理何时该提问:DiscoBench——面向澄清感知的深度搜索基准

arXiv cs.CL · 2026-06-29 缓存

DiscoBench 是一个新基准,用于评估基于 LLM 的搜索代理能否主动识别用户查询中的歧义、提出澄清性问题,并通过多轮交互恢复正确的推理路径。

0 人收藏 0 人点赞
#multi-step-reasoning

@rohanpaul_ai:该模型("Owl Alpha")专为代理工作负载设计:工具调用、多步推理、长上下文执行…

X AI KOLs Following · 2026-06-28 缓存

Owl Alpha 是一款专为代理工作负载设计的新模型,涵盖工具调用、多步推理、长上下文执行、代码生成、自动化工作流及 DevOps 任务等场景。

0 人收藏 0 人点赞
#multi-step-reasoning

探究LLM的问题解决能力——静力学问题研究

arXiv cs.CL · 2026-06-26 缓存

本文评估了LLM在静力学问题上的表现,发现虽然纯文本问题处理得较好,但引入图表和多步推理后准确率下降,表明模型在持续应用视觉信息方面存在困难。

0 人收藏 0 人点赞
#multi-step-reasoning

@Ankur_Samanta_: 在多步推理强化学习后训练中关于信用分配的新工作 介绍自重置策略优化 (SRPO…

X AI KOLs Timeline · 2026-06-22 缓存

自重置策略优化 (SRPO) 通过在多步推理强化学习后训练中定位第一个错误的推理步骤并从中学习反事实延续,而无需外部监督,来解决信用分配问题。

0 人收藏 0 人点赞
#multi-step-reasoning

学习细化隐藏状态以实现可靠的LLM推理

arXiv cs.LG · 2026-06-17 缓存

提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。

0 人收藏 0 人点赞
#multi-step-reasoning

哪些模型在继承推理中表现更好?

arXiv cs.CL · 2026-06-15 缓存

本文介绍了PSL团队在2026年阿拉伯伊斯兰继承推理共享任务(QIAS 2026 Shared Task)中的参与情况,对比了商业和开源大语言模型。结果显示,商业模型(如Gemini 2.5 Flash)在处理具有多步依赖的结构化法律推理方面显著优于开源模型。

0 人收藏 0 人点赞
#multi-step-reasoning

基于外部子图生成的大语言模型逐步推理增强

arXiv cs.CL · 2026-06-04 缓存

本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。

0 人收藏 0 人点赞
#multi-step-reasoning

智能体RAG中的级联幻觉:CHARM检测与缓解框架

arXiv cs.AI · 2026-06-04 缓存

本文介绍了CHARM框架,用于检测和缓解多步骤智能体RAG流水线中的级联幻觉问题——早期阶段产生的错误会在推理步骤中不断传播并放大。CHARM在多个基准测试中实现了89.4%的级联检测率和82.1%的错误传播降低率,且延迟开销较低。

0 人收藏 0 人点赞
#multi-step-reasoning

基于状态感知动态检索的Web智能体在线技能学习

arXiv cs.AI · 2026-06-04 缓存

本文提出了SGDR(State-Grounded Dynamic Retrieval,状态感知动态检索),一种面向Web智能体的在线技能学习方法,支持逐步、感知当前状态的技能复用,而非静态的任务级检索。在WebArena上的实验表明,SGDR结合GPT-4.1可达到37.5%的成功率,相较于强基线取得了约10.6%的相对提升。

0 人收藏 0 人点赞
#multi-step-reasoning

LLMs 并非你所认为的黑箱

Hacker News Top · 2026-06-02 缓存

一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。

0 人收藏 0 人点赞
#multi-step-reasoning

HyperGuide:大型语言模型中高效多步推理的双曲引导方法

arXiv cs.AI · 2026-05-26 缓存

本文提出HyperGuide方法,将推理进展提炼为双曲几何信号,以指导LLMs的逐步生成,从而无需显式树搜索即可提高多步推理效率。

0 人收藏 0 人点赞
#multi-step-reasoning

面向快速医疗互操作性资源(FHIR)中工具调用代理的强化学习

arXiv cs.LG · 2026-05-15 缓存

本文介绍了一种针对在FHIR医疗数据上运行的工具调用LLM代理的强化学习后训练流水线,在使用较小的Qwen3-8B模型时,在FHIR-AgentBench上达到了77%的答案正确率,而o4-mini仅为50%。

0 人收藏 0 人点赞
#multi-step-reasoning

Introducing GPT-5.5 with Box

YouTube AI Channels · 2026-05-08 缓存

GPT-5.5在多步推理和财务建模方面带来19个百分点的提升,显著减轻知识工作负担,令Box团队感到振奋。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈