超越监督式澄清:利用LLM重写输入以辅助对话篇章解析
摘要
本文研究了利用大型语言模型(LLM)重写碎片化对话话语以改进冻结的篇章解析器,发现零样本澄清不可靠,且通过重写进行错误修复存在实际上限,表明可重写性预测是一项缺失的关键能力。
arXiv:2607.01964v1 公告类型:新
摘要:重写输入以改进冻结的下游模型已成为现代NLP流水线中的常见策略。先前关于增量式对话篇章解析(DDP)的工作表明,监督式澄清模型可以重写碎片化或未充分指定的话语,例如解决省略或指代问题,以提高解析准确性。在本工作中,我们在现实部署条件下重新审视这一想法,此时没有可用的澄清监督,澄清器必须依赖零样本提示或来自冻结解析器的反馈。在三个分段话语表示理论(SDRT)数据集和多个解析器上,我们发现最后一句话的澄清远不如监督设置所显示的那样可靠。与解析器无关的重写往往引入更多退化而非修复,因为能实现修正的编辑同时会破坏解析器依赖的话语线索。一项最佳8次重写分析进一步揭示了实际上限:很大一部分错误无法仅通过输入重写来修复。使用GRPO训练的解析器感知澄清器通过学会保守放弃将退化率降低高达37%,但仍未能产生持续改进解析的选择性感知澄清。综合来看,这些发现将澄清重新定义为选择性干预问题。我们确定可重写性预测——在干预前判断话语是否可修复——是冻结篇章解析器输入侧优化的关键缺失能力,也是更广泛改进智能体流水线的重要方向。
查看缓存全文
缓存时间: 2026/07/03 05:41
# 超越监督式澄清:基于LLM的输入重写在对话篇章解析中的应用 来源:https://arxiv.org/abs/2607.01964 查看PDF(https://arxiv.org/pdf/2607.01964) > **摘要**:对输入进行重写以改进冻结的下游模型已成为现代NLP流水线中的常见策略。先前关于增量式对话篇章解析(DDP)的研究表明,监督式澄清模型可以重写片段化或欠规格化的语句(例如解决省略或指代问题),从而提高解析准确率。在本文中,我们重新审视了这一思路,并将其置于实际部署条件下——即没有可用的澄清标注数据,澄清器必须依赖零样本提示或从冻结解析器获得反馈。在三个分段话语表征理论(SDRT)数据集和多个解析器上的实验结果表明,对话末句的澄清远不如监督设置中所示的那样可靠。与解析器无关的重写常常引入比修复更多的退化,因为能够修复问题的编辑也会破坏解析器所依赖的话语线索。进一步的“最佳8次重写”分析揭示了一个实际天花板:很大一部分错误无法仅通过输入重写来修复。使用GRPO训练的感知解析器的澄清器通过学习保守式放弃将退化减少了37%,但仍然无法产生具备选择性感知的澄清来持续改进解析。这些发现共同将澄清重塑为一个选择性干预问题。我们将可重写性预测——即在干预前判断一个语句是否可修复的能力——确定为冻结篇章解析器输入侧优化的关键缺失能力,也是更广泛地改进智能体流水线的重要方向。 ## 提交历史 来自:刘一鸣 \[查看邮件 (https://arxiv.org/show-email/8fe5fce7/2607.01964)\] **\[v1\]**2026年7月2日星期四 09:57:52 UTC(428 KB)
相似文章
鲁棒批评者:防御LLMs免受多轮攻击
本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。
面向LLM Agent澄清请求的不确定性分解
本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
基于信息增益的LLM代理中的不确定性感知澄清
提出了一种目标导向的澄清框架,利用信息增益奖励训练LLM代理,在用户指令不明确的情况下提出有效的澄清问题,在仅增加少量交互开销的情况下,将任务成功率提升了3.7%。
迈向可靠且鲁棒的LLM规划:符号反馈驱动的迭代自我改进框架
本文提出了一种符号反馈驱动的迭代自我改进框架,以提高大语言模型在长周期规划任务中的鲁棒性和可靠性。该方法利用自然语言提示、符号验证器和计划识别器来增强可行性与正确性。