解耦LLM生成中的任务求解与输出格式化
摘要
介绍了Deco-G,一种解码框架,将LLM中的格式遵循与问题求解相分离,通过格式估计模块在不削弱推理能力的前提下确保合规。在数学推理、事件抽取和LLM作为评判者的任务中取得了更高的准确性。
arXiv:2510.03595v2 公告类型:替换
摘要:大型语言模型(LLM)在解决复杂问题(如数学推理和自动评估)方面日益熟练。然而,当提示中将任务指令与严格的格式化要求交织在一起时,性能往往会下降。这种纠缠给模型造成了竞争性目标,阻碍了其推理能力。为了解决这一问题,我们提出了Deco-G,一种解码框架,显式地将格式遵循与问题求解解耦。Deco-G将格式遵循委托给一个独立的格式估计模块(FEM),该模块通过概率前瞻估计未来的格式符合率并重新加权标记概率,使LLM能够专注于任务求解。为了使该方法既实用又高效,我们引入了三项关键创新:指令感知蒸馏、灵活的trie构建算法以及HMM状态剪枝。在数学推理、事件论元抽取和LLM作为评判者等实验表明,Deco-G始终优于提示或结构化生成基线,并保证格式合规。我们已在 https://github.com/haikangdeng/deco-g 上发布代码。
查看缓存全文
缓存时间: 2026/07/13 08:00
# 在 LLM 生成中解耦任务求解与输出格式化
**来源**: https://arxiv.org/html/2510.03595
Haikang Deng, Po\-Nien Kung, Nanyun Peng
University of California, Los Angeles
\{haikang, ponienkung, violetpeng\}@cs\.ucla\.edu
###### 摘要
大语言模型(LLM)在解决复杂问题(如数学推理和自动评估)方面越来越得心应手。然而,当提示词将任务指令与严格的格式化要求交织在一起时,性能往往会下降。这种纠缠给模型带来了相互冲突的目标,削弱了其推理能力。为了解决这个问题,我们引入了 **Deco-G**,这是一个解码框架,它明确地将格式遵循与问题求解解耦。**Deco-G** 将格式遵循委托给一个专门的格式估计模块(FEM),该模块执行概率预判以估计未来的格式符合率并重新加权 token 概率,从而使 LLM 能够专注于任务解决。为了使这种方法既实用又高效,我们引入了三项关键创新:指令感知蒸馏、灵活的 trie 树构建算法和 HMM 状态剪枝。在数学推理、事件论元抽取和 LLM-as-a-judge 上的实验表明,**Deco-G** 在保证格式符合的前提下,持续优于提示词或结构化生成的基线方法。我们在 haikangdeng/deco-g (https://github.com/haikangdeng/deco-g) 上发布了我们的代码。
---
## 1 引言
> 参见图注
> 图1: GSM8k 示例。无约束的提示词能给出正确答案但格式不符,而添加约束会降低推理精度。**Deco-G** 通过格式估计模块(FEM)解耦格式化,同时实现了严格合规和正确回答。
指令微调 (Wei et al., 2021; Chung et al., 2024) 赋予 LLM 解决复杂任务的能力,通常还会通过思维链 (Wei et al., 2022) 和思维树 (Yao et al., 2023) 等推理策略进行增强。然而,新出现的证据表明,将问题求解指令与严格的输出格式要求结合在单个提示词中会对性能产生负面影响 (Tam et al., 2024; Long et al., 2025; He et al., 2024)。例如,Long et al. (2025) 证明输出结构会显著影响 MMLU (Hendrycks et al., 2020) 等基准的精度,而 Tam et al. (2024) 观察到更严格的约束与更大的推理退化相关。这表明当前将任务指令和格式指令交织在一起(如图1所示)的范式可能会损害 LLM 的推理能力。为了缓解这个问题,近期工作探索了放宽格式严格性 (Tam et al., 2024) 或采用更直观的模式 (Long et al., 2025; He et al., 2024)。然而,这些调整仍然施加了约束,分散了 LLM 的推理注意力。或者,约束解码框架 (Beurer-Kellner et al., 2024; guidance-ai, 2024; Willard and Louf, 2023) 通过严格强制 token 转换来确保合规性。然而,这种刚性干预不考虑模型的内部推理流程,导致输出突兀中断或不连贯。这种权衡凸显了迫切需要一种框架,能够无缝地将格式约束与任务求解解耦,以释放 LLM 的全部潜力。
在本文中,我们介绍 **Deco-G**,这是一种明确将格式遵循与任务推理解耦的框架,允许 LLM 专注于问题求解,同时引入一个辅助模块来保证格式符合。具体来说,它利用了现有可控文本生成方法(如 GeLaTo (Zhang et al., 2023)、Ctrl-G (Zhang et al., 2024))的模块化特性,并将格式遵循委托给一个专门的格式估计模块(FEM),该模块持续估计最终的格式符合率并重新加权下一个 token 的分布以指导生成。虽然这项工作建立在 GeLaTo (Zhang et al., 2023) 和 Ctrl-G (Zhang et al., 2024) 的基础上,但据我们所知,它是第一个引入任务求解与格式遵循显式分离以保留 LLM 全部潜力的框架。此外,由于现有方法与指令微调 LLM 的兼容性有限,以及在处理复杂模板时存在计算瓶颈,直接应用它们会导致性能下降。为此,我们引入了三项创新:(1) 指令感知蒸馏以捕获任务导向行为;(2) 一种灵活的 trie 树算法用于高效自动机构建;(3) HMM 状态剪枝以加速推理。
为了评估 **Deco-G** 在不同约束类型上的有效性,我们在三个不同的任务上进行了评估:数学推理、事件论元抽取和 LLM-as-a-judge。实验表明,**Deco-G** 持续提升了整体任务性能,这归因于:(1) 保证 100% 格式符合;(2) 实现更自然、上下文感知的格式集成;(3) 使 LLM 能够专注于推理,摆脱格式化的认知负担。
我们的贡献如下:
- • 我们提出了一种新颖的解码框架,使用格式估计模块明确地将格式遵循与任务求解解耦,在强制严格约束的同时保留 LLM 的推理能力。
- • 我们引入了三项技术创新——指令感知蒸馏、灵活的 trie 树构建和 HMM 状态剪枝——它们带来的计算开销极小,使 **Deco-G** 框架适用于实际部署。
- • 我们在多种基准上展示了持续的性能提升,并通过详细分析引导机制和基于熵的控制动态提供了支持。
---
## 2 预备知识
本节回顾我们方法所基于的可控文本生成的相关工作,并强调这些方法虽然重要,但在实现我们高效任务-格式解耦的目标方面存在困难。我们的公式和技术贡献将在下一节介绍。
### 2.1 具有属性控制的生成
遵循先前工作,针对给定期望属性 $\alpha$ 的可控文本生成被公式化为 $P(x_{1:n} | \alpha) = \prod_t P(x_t | x_{<t}, \alpha)$。为了实现这一点,GeLaTo (Zhang et al., 2023) 引入了一个隐马尔可夫模型(HMM)作为属性模型 $P(x_{1:n} | \alpha) \approx HMM(x_{1:n} | \alpha)$,并以贝叶斯方式结合它:$P(x_t | x_{<t}, \alpha) \propto P(x_t | x_{<t}) \cdot P(\alpha | x_{1:t})$,其中后验 $P(\alpha | x_{1:t})$ 是使用 HMM 状态的后验估计的。Ctrl-G (Zhang et al., 2024) 随后通过使用用户指定的正则表达式直接构造 HMM($HMM(x_{1:n} | \alpha) \equiv regex(x_{1:n})$),使属性模型适应结构化约束。
### 2.2 将 HMM 与 LLM 结合的解码
给定一个满足正则表达式的 HMM,Ctrl-G (Zhang et al., 2024) 在每个解码步骤 $t$ 生成输出 $x_t$,如下所示:
1. **LLM 正向传递**: 计算语言模型概率 $P_{LM}(x_t | x_{<t})$。
2. **HMM 更新**: 使用发射概率 $P(x_t | s_t)$ 更新 HMM 的隐藏状态分布,其中 $s_t$ 是时间 $t$ 的隐藏状态。
3. **重新加权**: 添加一个控制项 $\gamma$ 来控制 $P_{LM}$ 和 HMM 后验之间的平衡:$P(x_t) \propto P_{LM}(x_t | x_{<t}) \cdot \exp(\gamma \log P(\alpha | x_{1:t}))$,其中 $P(\alpha | x_{1:t})$ 是通过前向算法计算的 HMM 后验。
虽然 Ctrl-G 保证了格式符合,但它有显著的局限性:(1) 由于属性 HMM 是从无条件采样中构建的,忽略了任务上下文,因此对指令微调模型的引导效果不佳;(2) 正则表达式到 HMM 的转换对于复杂模板而言计算成本高且脆弱;(3) 在具有大词汇量 $|\mathcal{V}|$ 的模型中,发射概率矩阵的存储和计算成为瓶颈。我们的框架 **Deco-G** 依次解决了这三个问题,确保了实际部署中的鲁棒分解和效率。
---
## 3 方法
**Deco-G** 的核心是为每个目标输出格式构建一个专用的格式估计模块(FEM)。FEM 是一个灵活构建的确定有限自动机(DFA),随后转换为 HMM,以便在执行期间进行增量概率更新。然后,来自 LLM 的原始输出分布通过 HMM 的后验似然度进行加权,确保在保留 LLM 因果推理流程的同时遵循格式约束。与先前工作相比,**Deco-G** 引入了三个关键组件以实现鲁棒且高效的解耦:
### 3.1 指令感知蒸馏
现有方法(如 Ctrl-G)的潜在弱点在于其属性模型是从无上下文的先验中构建的。为了说明这一点,我们使用 Llama-3.1-8B-Instruct 对 GSM8k 上的 10 个随机样本进行了一个小规模分析,通过仅提示任务而不提示格式(即自然地用自由文本回答)来获取其 LLM 输出。在检查这些输出时,我们观察到类似“The final answer is 42”的模式。然而,从无条件采样中构建的 HMM(如 Ctrl-G 中所做的那样)很可能对这些特定于任务的模式赋予低概率,而是支持“answer is 24”或“thus, the answer is 7”等变体。为了解决这个问题,我们提出了 **指令感知蒸馏**:不是使用通用或从无条件下采样的输出,而是首先使用仅包含任务指令的提示词运行 LLM(无格式约束),并收集由此生成的输出。从这个分布中,我们通过统计语言模型输出的 n-gram 频率来估计标准概率 $P(x_{1:L} | \text{task})$,并使用这些频率来初始化 DFA 中的转换权重。为了确保鲁棒性,我们在 DFA 构建期间,将初始转换为空 token(即 $\epsilon$-transition)的集中质量分散到在所有相关后续转换上。这种蒸馏过程使 FEM 能够捕捉到自然任务求解行为,从而实现更准确、上下文感知的引导。
### 3.2 灵活的 Trie 构建
接下来,我们解决从用户指定的正则表达式构建 DFA 的挑战。现有方法(如 Ctrl-G)通常需要为每个正则表达式模式设计专门的 NFA-to-DFA 转换算法,这对于涉及复杂嵌套或重复的模式来说计算成本高昂,有时甚至是不切实际的。我们的见解是,大多数实际的结构化格式可以用有限状态描述,这些状态对应于模板短语的线性序列,其间有时会有内容生成的间隙。基于此,我们设计了一个 **灵活的 trie 构建算法**,该算法将正则表达式解析为模板短语(文本段)和内容插槽(动态 LLM 生成点)的交替序列。对于每个模板短语,我们将其中字符依次插入 trie 中,并附带上文提到的蒸馏概率。对于每个内容插槽,我们添加一个自循环过渡,允许在指定范围内解码任意数量的 token(例如,1-5 个 token 用于论元抽取)。这种 trie 结构自然地形成 DFA:trie 中的每个节点对应一个状态,模板序列中的简单文本匹配由转换表示,而内容插槽则作为通配符转换处理。我们对该 DFA 应用标准的子集构造方法以获得最小化的 HMM。这种策略在灵活性和效率之间取得了平衡:它支持复杂的多段模板,同时保持构建和推理计算的实际可行。
### 3.3 HMM 状态剪枝
即使有了高效的 trie 构建,发射概率矩阵的维度仍然为 $h \times |\mathcal{V}|$,其中 $h$ 是 DFA 中的状态数,通常与模板复杂度相关。对于 Llama 和 Qwen 等模型($|\mathcal{V}| > 100k$),这种矩阵-向量乘法($O(h|\mathcal{V}|)$)显著增加了延迟。为了缓解这个问题,我们引入了 **HMM 隐藏状态剪枝**。该技术利用了隐藏状态分布的概率质量高度集中在一小部分状态上的观察(见图3)。我们不是使用完整的状态空间,而是仅考虑 **top-k** 最可能的状态来近似发射概率。经验上,仅选择前 5%($k=200$)就足以保留完整模型超过 98% 的性能。这种策略通过将发射复杂度从 $O(h|\mathcal{V}|)$ 降低到 $O(k|\mathcal{V}| + h \log h)$ 显著提高了效率,其中 $O(h \log h)$ 项用于选择前 k 个状态。由于 $k \ll h$,此优化在每个解码步骤实现了约 $13\times$ 的 FLOPs 减少,确保引导开销可忽略不计,同时保持稳健的格式符合。
---
## 4 实验
### 实验设置
我们在三个任务上评估 **Deco-G** 的整体性能:(1) 带推理的数学问题求解,(2) 作为生成任务的事件论元抽取,以及 (3) 用于摘要评估的 LLM-as-a-judge(见第4.3节)。我们将 **Deco-G** 应用于高性能指令模型 Llama-3.1-8B-Instruct (Grattafiori et al., 2024)、Qwen2.5-7B-Instruct (Yang et al., 2025b) 和 Qwen3-8B (Yang et al., 2025a),以验证其有效性。我们纳入比较的基线如下:
- • **仅提示词 (NL/JSON)**: 标准贪心解码,以任务指令和输出约束(自然语言或 JSON)为条件,无外部干预。
- • **结构化生成 (NL/JSON)**: 使用 Outlines (Willard and Louf, 2023) 的约束解码,严格强制目标输出格式,通过自然语言模板或 JSON 模式实现。
- • **Ctrl-G**: 可控生成基线,使用从无条件采样中蒸馏的 HMM 来指导生成,如 Zhang et al. (2024) 所述。
在以下实验中,我们采用贪心解码以确保与基线方法进行公平比较,并评估零样本性能。
| 表1: GSM8k 结果。**Deco-G** 保证格式满足,并在所有模型上持续优于 Prompt-Only 和 Outlines 基线。 |
### 4.1 数学推理
在此任务中,我们在 GSM8k (Cobbe et al., 2021) 上评估我们的框架,这是一个包含小学水平数学问题的集合,需要 2 到 8 步来解决。模型需要执行逐步推理并得出答案。遵循 Tam et al. (2024),我们采用一组任务提示词引导模型首先推理数学问题,然后输出一个整数作为答案。对于 JSON 格式输出,我们提示模型输出一个有效的 JSON blob,包含键 "reason" 和 "answer"。对于自然语言输出,使用格式指令鼓励模型生成模板短语 "The final answer is ..."。同时,该短语被指定为 **Deco-G** 生成中需出现的关键短语。
**评估指标**:我们测量 **格式符合率** 为生成答案遵循格式要求的比例。此外,我们测量 **准确率** 为与真实答案的精确匹配。
**结果**:如表1所示,**Prompt-Only (NL)** 提供了不错的性能,Llama 得分为 82.3%,Qwen2.5 为 83.6%,Qwen3 为 90.5%(准确率)。然而,非结构化生成方法完全依赖 LLM 来遵循格式约束,因此符合率较低。相反,结构化生成 (Outlines) 保证了格式符合,但其侵入性干预损害了任务性能。虽然 Ctrl-G 和 **Deco-G** 都保证格式符合,但 **Deco-G** 受益于指令感知 HMM 提供的更精确的控制信号,在所有三个模型上实现了最佳性能。在实践中,我们观察到 Qwen 模型具有更偏斜的 token 分布。因此我们提高控制因子 $\gamma$ 以对输出施加更强的控制。
### 4.2 事件论元抽取
生成式事件论元抽取 (EAE) 任务评估模型从源文本中识别与角色相关的论元的能力。我们在 ACE05-EN 数据集 (Doddington et al., 2004) 上进行评估,其中向模型呈现一篇文章、一个触发词和一组角色,以确定与角色相关的论元是否出现在文章中。这自然是一个模板化任务,因为生成模型必须指定为哪个角色提取了哪个词。对于 JSON 输出,我们要求模型生成一个 JSON blob,其中角色作为键,提取的论元作为值。对于自然语言输出,我们为每个相关角色指定模板 "The <role> is <argument>"。对于 **Deco-G**,我们构建一个灵活的 DFA,将模板短语与允许 LLM 预测 1 到 5 个 token 长度的论元的空位融合在一起。
**评估指标**:我们通过计算提取的元组与真实元组之间的 **f1 分数** 来衡量以下类别的性能:论元身份 (AI)、论元类别 (AC)、论元附加身份 (AI+)、论元附加类别 (AC+)。
**结果**:表2中报告的 f1 分数表明,EAE 对于生成模型仍然是一个具有挑战性的任务。LLM 在识别文章中的正确关系以及呈现原始文本中存在的有效预测方面存在困难。基线方法在模型之间表现出不一致的趋势,表明 LLM 在事件论元抽取中缺乏鲁棒性。采用 **Deco-G** 提升了 Llama 和 Qwen3 的整体抽取质量,同时在 Qwen2.5 上主要改进了 AI 和 AI+。**Deco-G** 在 AI 和 AI+ 上的增益比在 AC 和 AC+ 上的改进更明显,这表明 **Deco-G** 可以从角色与提取论元之间更紧密的关联中进一步受益。
| 表2: ACE05 上的生成式 EAE 结果。 |
| 表3: SummEval 结果,衡量连贯性、一致性、流畅性和相关性。 |
### 4.3 LLM-as-a-judge 评估
然后我们使用 LLM 作为法官来评估摘要的质量,并评估其与人类注释的一致性。此评估在 SummEval (Fabbri et al., 2021) 上进行,该数据集包含 100 篇新闻文章的 1600 个机器生成的摘要以及四个维度的人类注释分数:连贯性、一致性、流畅性和相关性。模型被要求分析摘要并根据 ChatGPT (OpenAI, 2025) 建议的给定标准分配 1 到 5 的分数。对于自然语言输出,我们使用格式 "The rating is <score>";对于 JSON 输出,使用键 "rating"。
**评估指标**:遵循 Liu et al. (2023),我们采用摘要级别的 Spearman 和 Kendall-Tau 相关性来衡量每种方法的性能。数值越高表示与人类注释分数的一致性越好。
**结果**:对于此任务,Qwen 模型在非结构化设置中遵循输出格式方面表现良好,符合率超过 99.7%。这可能归因于与数学推理相比推理阶段要求较低。如表3所示,**Deco-G** 展示了与人类注释者最强的平均相关性,应用于 Qwen 模型时,在一致性、流畅性和相关性方面都有提升。定性检查显示,**Deco-G** 能够将评分短语灵活集成到任意位置,而非结构化和结构化基线总是在分析结束后才附加评分。
---
## 5 分析
### 5.1 复杂度和效率
> 参见图注
> (a) Llama-3.1-8B-Instruct相似文章
学习如何让大语言模型进行推理
OpenAI 发布了一篇文章,通过密码破译示例探索大语言模型的推理技术,展示了语言模型的逐步问题求解和模式识别能力。
揭示大语言模型中的数学推理:内部机制的方法学研究
本文通过早期解码分析大语言模型的内部机制,研究其如何执行算术运算。研究发现,能力强的模型在推理任务中,注意力模块和 MLP 模块之间呈现明确的分工。
Decoding-Level Taboo:一种针对LLM鲁棒性的解码级诊断压力测试
本文介绍了Decoding-Level Taboo,这是一种运行时logit空间压力测试,通过迫使LLM偏离其常规生成路径来评估路径外鲁棒性,结果表明鲁棒性随模型规模和指令对齐程度的提高而改善。
解耦分析-判断:一种用于复杂多步创意任务的基于LLM的自动化创意评估器
本文介绍了CreaEval,一种针对复杂多步任务的自动化创意评估器,通过解耦分析与判断来减少偏差并提高评估可靠性,实验显示其相比基线平均性能提升22.74%。
DecoEvo: 文本空间中求解器与评分器生成技能的分数解耦协同进化
介绍了DecoEvo,一种用于文本空间中LLM优化的分数解耦协同进化方法,无需黄金评分标准即可同时提升求解器和评分器生成技能,在五个基准测试中相比基线实现了2.8%–5.0%的相对提升。