通过混合模式优势正则化减轻大型推理模型中的事实幻觉

arXiv cs.CL 论文

摘要

介绍了MARGO,一种强化学习框架,通过比较思考和非思考轨迹,使用混合模式优势正则化来减轻大型推理模型中由思考引发的幻觉。

arXiv:2607.05861v1 公告类型:新 摘要:大型推理模型(LRMs)通过在最终答案之前生成显式的思考轨迹来提升语言模型的能力。在面向事实的问答(QA)中,这种思考通常通过帮助模型恢复相关知识并改进答案来提升整体性能。然而,我们发现这种好处在实例层面并不均匀:显式思考有时会推翻正确的非思考答案,导致事实漂移。我们将这种失败模式称为\emph{思考引发的幻觉}。为解释这一现象,我们将面向事实的问答中的显式思考建模为模型直接回答倾向上的思考残差,该残差要么恢复缺失的知识,要么引入无依据的关联。基于这一建模,我们提出了MARGO,即\underline{\textit{M}}ixed-Mode \underline{\textit{A}}dvantage \underline{\textit{R}}egularization for \underline{\textit{G}}rounded \underline{\textit{O}}ptimization(混合模式优势正则化用于接地优化),这是一种强化学习框架,在优势估计中使用非思考轨迹作为同模型参考。通过构建包含思考和非思考轨迹的混合模式轨迹组,MARGO评估显式思考是否在直接回答之外增加了事实价值,从而抑制易产生幻觉的思考,同时保留有益的思考行为。在多个面向事实的问答基准上的实验表明,MARGO在强基线之上提高了事实可靠性,而在数学基准上的评估则表明它保留了通用推理能力。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:41

# 通过混合模式优势正则化缓解大型推理模型中的事实幻觉
来源:https://arxiv.org/abs/2607.05861
查看PDF (https://arxiv.org/pdf/2607.05861)

> 摘要:大型推理模型(LRMs)通过在最终答案前生成显式思考轨迹来提升语言模型能力。在面向事实性的问答(QA)中,这种思考通常有助于模型恢复相关知识并优化答案,从而提升整体性能。然而,我们发现这种收益在实例层面并不均匀:显式思考也可能推翻正确的非思考答案,导致事实偏移。我们将这种失败模式称为*思考引发的幻觉*。为解释这一现象,我们将事实性问答中的显式思考形式化为模型直接回答倾向上的思考残差,该残差既能恢复缺失的知识,也可能引入无根据的关联。基于这一形式化,我们提出了 MARGO(*流*式模式优势正则化用于*有根基的优化*,即 *Mixed-Mode Advantage Regularization for Grounded Optimization*),这是一种强化学习框架,在优势估计中使用非思考展开作为同模型参考。通过构建包含思考与非思考轨迹的混合模式展开组,MARGO 评估显式思考是否在直接回答基础上增加了事实价值,从而抑制易产生幻觉的思考,同时保留有益的思考行为。在多个面向事实性的问答基准上的实验表明,MARGO 相较于强基线提高了事实可靠性,而在数学基准上的评估则显示其保留了通用推理能力。

## 提交历史

来自:Kaishen Wang [查看电子邮件](https://arxiv.org/show-email/6224f4ff/2607.05861)  
**[v1]** 2026年7月7日星期二 05:34:25 UTC (1,065 KB)

相似文章

MeasHalu:通过增强推理缓解大语言模型的科学测量幻觉

arXiv cs.CL

# MeasHalu:通过增强推理缓解大语言模型的科学测量幻觉 来源:[https://arxiv.org/html/2604.16929](https://arxiv.org/html/2604.16929) Ruijun Huang1,Zhiqiao Kang1,Yuxuan Zhu1,Junxiong Li1,Jiahao Zhao1, Minghuan Tan1,Feng Jiang211footnotemark:1,Min Yang1 1 中国科学院深圳先进技术研究院高性能数据挖掘深圳市重点实验室 2 深圳大学人工智能研究院

面向事实的推理学习

arXiv cs.CL

本文提出了一种新颖的在线强化学习方法,通过设计兼顾事实精确性、细节丰富度和回答相关性的奖励函数,来提升推理大语言模型的事实准确性。在六个基准测试上,该方法将幻觉率降低了23.1个百分点。

RAGognizer:通过检测头集成实现幻觉感知微调

arXiv cs.CL

RAGognizer 提出了一种幻觉感知微调方法,该方法将轻量级检测头集成到大语言模型(LLMs)中,以实现语言建模与幻觉检测的联合优化,适用于 RAG 系统。论文介绍了 RAGognize,一个包含自然发生的闭域幻觉及其词元级标注的数据集,并展示了在降低幻觉率的同时,实现了最先进的幻觉检测性能,且不损害语言质量。