标签
G-SHARE 是一种基于指南的结构化推理框架,用于核电站人因事件诊断。它将九步诊断指南操作化为一个多阶段流水线,包括证据提取、逐步推理和一致性修复,性能优于一次性大语言模型提示和传统基线方法。
本文提出GradeSQL框架,使用结果奖励模型(ORM)进行Text-to-SQL的测试时验证,在BIRD和Spider基准上分别比基于执行的Best-of-N方法提升4.33%和2.10%。
Flow Reasoning Models (FRMs) 为离散流模型在结构化推理任务上引入了一个训练和测试时扩展框架。通过使用 self-verification 和 self-conditioning,FRMs 在 Sudoku 和 Zebra 谜题上达到了近乎100%的求解率,而所需的迭代次数远少于之前的基准模型。
本文提出一种五臂消融方法论,用于诊断检索预热能量基推理(RW-EBR)中哪个组件驱动性能提升,应用于图可达性和数独等结构推理任务。该方法分离了类先验偏差、随机预热启动和图对齐值重用三种效应的影响。
ScaleToT提出了一种方法,旨在将结构化LLM推理泛化到十亿级低活跃用户建模中,通过思维树(ToT)精炼和训练学生模型来降低成本。在广告部署中的在线A/B测试显示,LT30提升了6.738%。
IBM在Hugging Face上发布了一篇开源博客,详细介绍了如何构建具有结构化推理和工具使用的强大企业级智能体,超越了基本的LLM和智能体。
提出了伪代码引导的结构化推理框架(PStar),该框架自适应地选择结构化伪代码推理路径以减少视觉语言模型中的幻觉,在POPE和MMStar基准测试上取得了最先进的分数。