PragReST: 自我增强的反事实推理用于语用语言理解
摘要
PragReST 是一个自监督框架,通过生成反事实推理轨迹并利用监督微调和强化学习训练模型,提升大语言模型的语用推理能力,在语用基准测试上取得了显著提升,且无需人工标注数据。
查看缓存全文
缓存时间: 2026/06/18 05:45
# PragReST:面向语用语言理解的自强化反事实推理 来源:https://arxiv.org/html/2606.18624 Jihyung Park Minchao Huang¹¹⁺Leqi Liu Elias Stengel-Eskin 德克萨斯大学奥斯汀分校 ###### 摘要 自然语言理解通常依赖于隐含而非明确陈述的含义,这需要语用推理。尽管大型语言模型(LLMs)在数学和逻辑推理方面表现出色,但在进行语用推理时仍然存在困难,常常倾向于选择字面解释。为了提升LLM的语用推理能力,我们提出了PragReST,这是一个自监督框架,能够构建语用问答数据、生成反事实推理轨迹,并通过监督微调和强化学习训练模型内化这些轨迹,且无需人工标注的训练数据或从更强的教师模型进行蒸馏。在四个语用基准(PragMega、Ludwig、MetoQA和AltPrag)上,PragReST相对于基础模型、特定任务语用调优基线以及相同流程的非反事实变体均有提升。在基于准确率的基准上,PragReST相对于指令基础模型,在Qwen3-8B和Qwen3-14B上分别提升了5.37%和5.50%(绝对百分比)。我们的错误分析和消融实验强调了反事实推理的重要性:PragReST主要减少了因未能将实际话语与合理备选方案进行对比而导致的错误,并且移除反事实推理会显著降低性能。此外,我们的训练保持了在通用知识和数学推理基准上的域外性能。¹代码和模型可在此处获取。 PragReST:面向语用语言理解的自强化反事实推理 Jihyung Park††致谢:同等贡献。Minchao Huang¹¹⁺Leqi Liu Elias Stengel-Eskin 德克萨斯大学奥斯汀分校 ## 1 引言 图1:PragReST中反事实语用推理示例:成功恢复意图含义涉及对备选话语的推理。与指令模型相比,PragReST将偏好从字面解释转向了预期的语用解释。 稳健的语言理解需要恢复说话者未明言的意图、假设和隐含含义(Grice, 1975),即,进行超越字面含义的语用推理,并对共同语境、说话者目标以及诸如会话含义和预设等背景信息进行推理(Levinson, 1983)。人类在日常对话中可以轻而易举地进行这些推理。尽管大型语言模型(LLMs)在数学和代码等推理密集型领域有了显著提升(Shao等人, 2024; Trung等人, 2024),但最近的研究表明,它们在语用推理任务上仍然存在困难(Ruis等人, 2023; Hu等人, 2023; Ma等人, 2025; Sravanthi等人, 2024)。这些发现指出了LLM与人类在语用推理方面持续存在的差距,表明表面流畅性和广泛的语义能力本身并不构成稳健的交际理解(Fried等人, 2023)。从根本上说,语用推理可以被框架为一个反事实推理过程:为了解释一段话语,听者会将说话者实际所说的话与他们在备选意图下可能说的话进行比较(Frank and Goodman, 2012)。听者并非仅根据是否与字面词语相符来判断一种解释,而是会问:如果这种解释是意图所在,说话者是否会选择不同的表述?图1展示了这一过程:当Mary回答Ken关于茶的问话“在杯子里”时,字面解释可能是她想要她的茶装在杯子里,而反事实推理过程则揭示了Mary的不满。事实上,反事实推理和语用推理在大脑反应层面已显示出关联(Kulakova and Nieuwland, 2016),并且反事实推理是迭代最优反应(IBR)(Franke, 2009)和理性言语行为(RSA)(Frank and Goodman, 2012; Goodman and Frank, 2016)等语用框架的核心,这些框架都将语用解释视为说话者和听者之间关于交际备选方案的递归推理。 鉴于语用推理被框架化为一个推理过程,一个自然的问题是,最近面向推理的后训练方面的进展是否也能用于教授反事实语用推理。基于可验证奖励的强化学习(RLVR)通过奖励其最终答案可由确定性验证器检查的推理轨迹,推动了数学和代码领域的进展(Shao等人, 2024; Trung等人, 2024)。语用推理缺乏这种验证信号:一种解释是否正确通常取决于微妙的语境假设、说话者目标和社交期望,因此,相同的话语在语境的微小变化下可能支持不同的含义(Fried等人, 2023; Anuranjana等人, 2024)。第二个挑战是可扩展的语用监督稀缺。大规模人工标注成本高昂,因为标注者不仅要判断表面正确性,还要判断一种解释在语境中是否得到许可。从更强的教师模型进行蒸馏也是一种不完美的替代方案:蒸馏性能受限于教师模型自身进行语用推理的能力,即便是最前沿的模型在这方面也可能表现不佳(Ma等人, 2025; Sravanthi等人, 2024)。 为应对这些挑战,我们提出了通过自训练进行语用推理(PragReST),这是一个从自生成数据中学习反事实语用推理的框架。PragReST是自强化的,因为它不依赖人工标注的语用训练数据、基准监督,或依赖更强的外部教师模型将语用知识蒸馏到策略中。相反,整个流程中使用的是同一个模型。如图2所示,PragReST分两个阶段进行。首先,模型通过从领域种子、少样本示例和语用现象描述中生成场景、问题和目标解释,来构建一个语用训练集。同一个模型会对这些生成的实例进行审核,以移除低质量、有歧义或无效的示例。其次,PragReST将这些经过筛选的问题转化为训练数据,用于教授模型反事实语用推理,遵循两种训练范式:监督微调(SFT)和强化学习(RL)。对于SFT,我们首先通过一个提示(该提示明确鼓励模型将实际话语与合理的交际备选方案进行比较)来生成特权答案轨迹,然后在移除该提示的情况下训练模型处理这些轨迹。这教会了模型内化反事实推理。在RL阶段,我们通过GRPO(Shao等人, 2024)进一步微调模型,使用自判定的正确性奖励在筛选后的问题上训练模型。 我们使用PragReST训练两个尺寸的推理模型:Qwen3-8B和Qwen3-14B(Qwen Team, 2025)。我们在四个语用基准上进行了评估:PragMega(细粒度语用问答;Hu等人, 2023)、Ludwig(会话含义解释;Ruis等人, 2023)、MetoQA(转喻指代消解;Sravanthi等人, 2024)和AltPrag(开放式语用恢复;Yu等人, 2026)。我们的核心科学问题是何种推理对于语用推断是重要的。为了回答这个问题,我们将PragReST与一个非反事实变体进行比较,该变体保留了相同的数据构建、筛选和训练方法,但将反事实推理指令替换为通用语用指令。这个变体相对于指令基础模型仅取得有限的平均改进。相比之下,在三个基于准确率的基准(PragMega、Ludwig、MetoQA)上,PragReST相对于指令基础模型的平均准确率提升,Qwen3-8B为5.37%,Qwen3-14B为5.50%。这种对比表明,反事实推理——而非额外的数据、任务暴露或RL优化——是语用推理的关键要素。在第5.1节中,我们的错误分析显示,PragReST的收益集中在涉及字面解释或错过交际意图的失败模式中,这些情况下正确答案取决于将实际话语与合理的备选方案进行对比。这也表明PragReST的收益源于反事实推理。在第5.2节中,我们还确认,这些收益不会显著降低在来自MMLU-Pro(Wang等人, 2024)、MATH-500(Lightman等人, 2024; Hendrycks等人, 2021)和AIME2025(OpenCompass, 2025)的通用知识和数学推理任务上的域外性能。 ## 2 相关工作 语言模型中的语用学。语用解释一直被研究为关于说话者意图、语境备选方案和共享背景假设的推理。一个经典的公式化是理性言语行为(RSA)框架,它将语用解释建模为说话者和听者之间关于在给定语境中说话者为何选择某段话语而非另一段的概率性递归推理(Frank and Goodman, 2012; Goodman and Frank, 2016)。这一视角也启发了超越经典指称博弈的语用解释计算研究(Fried等人, 2018; Vaduguru等人, 2024)。最近的基准测试表明,即使是强大的LLM在依赖语境的解释上仍然脆弱,包括会话含义、预设、指示语、转喻指代和开放式语用恢复,并且在不同的现象和设置中,与人类相比存在显著且不均衡的差距(Hu等人, 2023; Ruis等人, 2023; Sravanthi等人, 2024; Yu等人, 2026; Ma等人, 2025; Fried等人, 2023)。最近的训练方法通过特定任务的偏好调优或教师生成的思维监督来改进语用推理(Wu等人, 2024; Sravanthi等人, 2025)。这些方法表明,语用推理可以从专门的监督中受益,但它们依赖于外部的语用数据、偏好标注或教师生成的理由。相比之下,PragReST在自包含的训练循环内自生成训练数据,并将反事实推理作为生成、筛选和强化推理轨迹的组织原则。 图2:PragReST的高级概览。该过程从领域种子的自生成开始。QA任务提示通过结合通用指令、领域种子和语用分类描述来构建。生成的数据由自我审判器进行筛选。对于SFT,黄金答案使用反事实(CF)指令预先生成,该指令在最终的SFT输入中被移除。我们还应用了第二步筛选,以移除模型即使使用语用指令也返回错误答案的示例。 语言模型中的自我改进。先前关于LLM自我改进的工作是在模型生成的数据、理由或奖励上进行训练,但主要集中在对确定性任务和可验证奖励的领域。早期的理由引导方法训练模型在自生成导致正确答案的推理上进行训练,而后来的工作通过期望最大化风格的自训练、强化微调、基于一致性的理由筛选、无监督自训练和自主课程生成来扩展这一范式(Zelikman等人, 2022, 2024; Singh等人, 2024; Trung等人, 2024; Lee等人, 2025; Xu等人, 2025; Sun等人, 2025; Zhao等人, 2025)。诸如Self-Instruct和Evol-Instruct等合成数据方法进一步表明,LLM可以扩展自己的训练分布,而不仅仅是重新标注固定的数据集(Wang等人, 2023; Xu等人, 2024)。这些方法主要针对数学、代码或指令遵循等场景,在这些场景中,正确性可以通过真实答案、执行器或验证器模型来检查;PragReST将这一范式扩展到开放式的语用学领域,其中任务分布和正确性信号都必须被构建:模型生成语用QA实例,使用自我审判器进行筛选,并使用受限的二元正确性判断器,而不是通用的质量或偏好评估器。这使PragReST与基于LLM的评估器和自奖励系统(Liu等人, 2023; Kim等人, 2024; Yuan等人, 2024)相联系,同时避免了完全通用的判断器公式,后者可能在不同领域脆(Zheng等人, 2023; Huang等人, 2025; Raina等人, 2024)。PragReST也与带有特权信息的自蒸馏和上下文蒸馏相关,其中教师策略的条件是在推理时学生无法获取的信息(Nguyen等人, 2
相似文章
STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation
This paper introduces STRIVE, an LLM-based framework for jointly generating and evaluating controlled event sets for psycholinguistic plausibility judgments. Experiments show that adding a global reasoning scratchpad and evaluator-guided refinement substantially improves generation quality, though near-boundary events remain challenging.
REFACT:面向紧凑且忠实思维链的自适应事实重述
ReFact提出了一种自适应的事实重述引用框架,训练大语言模型自主决定推理步骤何时需要上下文支撑,从而在减少令牌消耗的同时提升思维链推理的忠实度和紧凑性。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
从智能体轨迹中诱导推理原语
介绍推理原语诱导(Reasoning Primitive Induction)方法,该方法从成功的ReAct轨迹中挖掘,将重复出现的推理动作聚类为类型化的伪工具,在基准测试上比原始智能体高出数十个百分点。
CoRA: 面向可靠思维链推理的置信度-理由对齐
本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。