还有何待修复?探索对话生成工件中修订传播的成本效益测试时计算
摘要
本文提出了一个基于LLMs的对话生成工件修订传播基准,并评估了成本效益测试时计算方法,表明并行采样与选择相结合可提高准确性。
arXiv:2609.03254v1 公告类型:新
摘要:大型语言模型(LLMs)通常通过对话中的迭代生成和修订循环帮助用户生成工件。这里的挑战是,当用户在修订时仅指定局部更改,LLMs必须识别相关依赖并将修订传播到工件的所有受影响部分。本文研究了LLMs在对话生成工件上的这种能力,其中工件上下文及其依赖可能嵌入在对话历史中。为了实际应用,我们还探索了针对这种新设置的成本效益测试时计算。具体而言,我们引入了一个针对此设置的新基准,并使用gpt-oss-20b/120b、gpt-5.4-mini和qwen3.5-9b/27b/122b在基准上评估了九种修订方法,包括顺序反思和并行采样变体。结果显示,基线方法的准确率达到68.3%至93%,最具成本效益的方法是从三个并行样本中选择,使用基于LLM或中心点选择,这使准确性提高了2.2%至9.7%。我们的代码和数据集可在https://github.com/ntt-dkiku/llm-revision-propagation获取。
查看缓存全文
缓存时间: 2026/09/04 05:56
# 还有什么需要修复?探索对话生成制品中修订传播的经济高效测试时计算
来源:https://arxiv.org/html/2609.03254
###### 摘要
大型语言模型(LLM)通常通过对话中的迭代生成和修订循环帮助用户生成制品。这里存在一个挑战:当用户在修订时仅指定局部变更,LLM 必须识别相关依赖并将修订传播到制品的所有受影响部分。本文研究了 LLM 在对话生成制品上的这种能力,其中制品及其依赖可能嵌入在对话历史上下文中。为了实际应用,我们还探索了针对此新场景的经济高效测试时计算。具体而言,我们为此场景引入了一个新基准,并使用 gpt-oss-20b/120b、gpt-5.4-mini 和 qwen3.5-9b/27b/122b 在基准上评估了九种修订方法,包括顺序反思和并行采样变体。结果显示,基线方法准确率为 68.3–93%,而最具成本效益的方法是从三个并行样本中选择一个,可使用基于 LLM 或中位数选择法,将准确率提高 2.2–9.7%。我们的代码和数据集可在 https://github.com/ntt-dkiku/llm-revision-propagation 获取。
## 1 引言
参见图注图 1:对话生成制品中修订传播的示例。给定一个局部修订请求,LLM 必须识别隐式依赖关系,并不仅更新明确提及的元素,还要更新其他依赖元素以保持一致性。
参见图注图 2:RevPropBench 概览。上半部分展示了基准构建过程,下半部分展示了评估过程。样本通过基于 LLM 的合成采样和人工标注生成。
大型语言模型(LLM)已成为高效生成文档、代码和计划等制品的通用工具。此生成过程通常涉及用户与 LLM 通过对话进行的迭代生成和修订循环。这里存在一个问题:在请求修订时,用户通常觉得难以或费力地明确指定受请求影响的制品的所有部分。因此,LLM 必须识别相关部分并在制品上传播所需的修订以保持一致性。此问题在基于 LLM 的仓库级代码(Jimenez 等, 2024; Bairi 等, 2024; Du 等, 2025)中已得到广泛研究,其中 LLM 必须定位相关文件并跨代码库范围的依赖关系传播编辑。最近,类似传播问题在基于 LLM 的知识编辑(Cohen 等, 2024; Dong 等, 2025)中也被研究,其中事实编辑被期望传播到相关事实或逻辑连接的知识;在基于 LLM 的文档编辑(Wang 等, 2026; Kruthof, 2026)中,局部修订可能需要更新依赖的文档元素或声明以保持一致性。然而,这些工作侧重于依赖关系大多显式或可静态分析的制品:在编码中通过调用图、导入和变量引用;在知识编辑中通过预先存在的知识图;在文档编辑中通过章节、图表、引文或声明的引用。相比之下,对于支持规划(图1)等实际任务的对话生成制品,元素之间的依赖关系通常是隐式的,并且可能通过周围的对话上下文(即制品之外)建立。在此实际场景中的修订传播尚未得到探索。
受此启发,本文研究了 LLM 在此类对话生成制品中跨依赖元素传播修订的能力111本文侧重于 JSON 格式的制品,因为 JSON 通常在 LLM 系统中用作输出格式。为了实际应用,我们还研究了如何经济高效地利用测试时计算来提升性能。具体而言,我们引入了 RevPropBench,这是一个新的人工标注基准,用于评估新场景中的修订传播。它包含 30 个开发样本和 120 个测试样本,涵盖九个领域,涉及规划、记录保存和配置,制品规模有三种:10、50 和 100 个 JSON 元素。然后,我们使用 gpt-oss-20b/120b、gpt-5.4-mini、qwen3.5-9b/27b/122b 在基准上评估了九种修订方法,包括顺序反思和并行采样变体。结果显示,LLM 可以在单次推理中传播修订,准确率为 68.3–93%,因模型而异。在测试时计算方法中,使用基于 LLM 或基于中位数的选择从三个并行样本中选择一个是成本效益最高的,可将准确率提高 2.2–9.7%。
总之,我们的贡献有三个方面:
- • 我们提出了一个新的基准,用于评估 LLM 在对话生成的 JSON 制品中跨依赖元素传播修订的能力(第2节)。
- • 我们在基准上全面评估了六种 LLM 上的九种修订方法,为经济高效的方法选择提供了实用指导(第4.2节)。
- • 我们发布了基准实例、数据采样和标注工具,以实现可重复性和未来扩展。
## 2 RevPropBench
(a) 按制品大小划分的传播规模。(b) 按领域划分的传播规模。(c) 传播模式。
图 3:RevPropBench 的统计数据(n=150 个样本,跨 9 个领域和 50 个场景)。
图2 展示了我们提出的 RevPropBench 的概览。下面我们描述任务定义、基准构建过程(数据采样、人工标注和统计)以及评估过程(数据划分和指标)。
### 2.1 任务定义
基准包括两个阶段:生成阶段和修订阶段。在生成阶段,LLM 通过与用户多轮对话逐步向 JSON 制品添加元素。在随后的修订阶段,用户提供一个局部修订请求,LLM 通过输出 JSON 补丁(RFC 6902)相应地修订制品的相关元素。生成阶段的对话是预先准备好的,因此任务是在修订阶段修订制品。在此,我们评估 LLM 是否能够对制品进行完全必要的修订,即生成的补丁是否在路径和值上都与标准补丁匹配。
### 2.2 合成数据采样
对于基准中的每个样本,我们准备了 LLM 与用户之间的对话历史,包括生成的 JSON 制品、用户的局部修订请求以及相应的标准补丁。样本使用强大的 LLM(例如 GPT-5.5)合成生成,以实现可控的数据采样。我们首先通过 LLM 辅助的头脑风暴创建场景,每个场景指定对话流程和修订传播模式。场景设计遵循三个标准:覆盖多样化的领域、覆盖多样化的传播模式,以及确保标准补丁在后续标注中是确定性定义的。然后,我们使用这些场景提示 LLM 生成合成的用户-LLM 对话历史和局部修订请求,类似于现有的合成对话生成(Ding 等, 2023; Xu 等, 2023)。每个 LLM 回合包括向制品添加至少一个元素的补丁,顺序应用这些补丁会生成一个最终制品。最终制品大小通过改变最大对话轮次来控制:每个对话进行到此限制,但一旦达到目标元素数量即提前停止。
### 2.3 LLM 辅助的人工标注
对于每个生成的样本,我们标注与修订请求对应的标准补丁。我们首先使用另一个强大的 LLM(例如 Claude-Opus-4.8)为每个样本生成暂定标准补丁。然后,人工标注者通过标注工具的 GUI 审查和纠正补丁,必要时咨询 LLM。标注工具的详细信息见附录 C.2。JSON 补丁(RFC 6902)是修改 JSON 制品的操作有序序列。每个操作是一个三元组 (op, path, value),其中 op ∈ {replace, add, remove} 指定要应用的操作,path 指定目标元素,value 是新内容。对于可以不同方式表述的自由形式值,我们定义匹配器检查所需关键词而非精确字符串匹配。我们还允许标注者为那些编辑和保持不变在上下文中都有效的元素分配一个可选标志。可选元素在任一情况下都被视为正确,仅当它们被编辑为错误值时才计为错误。
### 2.4 指标
我们通过比较 LLM 生成的补丁与标准补丁来评估 LLM。我们的主要指标是完成率:即修补后的 JSON 制品与标准修补制品完全匹配的样本比例。在失败分析中,我们还报告三个更细粒度的指标:遗漏(miss)用于省略的必要编辑,过度编辑(over edit)用于不必要的编辑,以及错误值(wrong value)用于必要编辑中的错误值。
### 2.5 基准实例
在本文中,我们创建了跨九个实际领域的 50 个场景,包括旅行行程、发票、购物车、项目计划、课程计划、数据管道、软件部署配置、组织访问计划和制造 BOM。对于每个场景,我们生成三个样本,JSON 制品包含 10(小)、50(中)和 100(大)个元素,总共产生 50 × 3 = 150 个样本。图3 总结了实例化基准的统计数据。随着制品元素数量的增加,传播的修订数量增加(图3(a)),而跨场景的特征传播模式分布展示了基准涵盖的修订传播案例的多样性(图3(c))。
## 3 评估设置
#### 数据划分
我们将 150 个样本划分为用于提示调优的开发集和用于评估的测试集。划分在场景级别进行,每个场景的所有三个大小变体被分配到相同的划分。我们通过随机抽样(种子为 42)将 50 个场景中的 10 个(即 30 个样本)分配给开发集,并按领域、传播规模和传播模式进行平衡。剩余的 120 个样本构成测试集,所有报告的指标都在此计算。
#### 评估的修订方法
我们评估了九种方法,涵盖单次通过基线和测试时计算方法,包括顺序反思和并行采样变体:
- • 基线在单次推理中生成补丁,提供最终 JSON 制品(j)、对话历史(h)或两者(j+h)作为辅助上下文。
- • 顺序反思(Reflect)从使用 j+h 生成的补丁开始,并通过反思迭代优化它。
- • 基于规则选择的并行采样,类似于自一致性(Wang 等, 2023),首先使用 j+h 并行生成多个补丁,然后根据预定义规则从中生成最终补丁。or、and 和 maj 分别在任一候选提议更改时、所有候选对同一新值达成一致时,以及严格多数对同一新值达成一致时更新叶元素。med(中位数选择)受最小贝叶斯风险解码(Eikema 和 Aziz, 2022)启发,选择其生成的制品与其他制品在叶级分歧最小的候选。更多细节见附录 D。
- • 基于 LLM 选择的并行采样(Select)首先使用 j+h 并行生成多个补丁,然后使用相同的 LLM 选择其中一个作为最终补丁。
#### 评估的 LLM
我们使用了六种代表性的 LLM,涵盖两个模型家族和三个不同的参数规模:gpt-oss-20b/120b(OpenAI 等, 2025)、gpt-5.4-mini(OpenAI, 2026)和 qwen3.5-9b/27b/122b-a10b(Qwen 团队, 2026)。所有模型都启用了推理,GPT 模型的努力级别设置为中等。
#### 超参数
我们为所有支持的模型设置温度为 0.6,gpt-5.4-mini 除外,并将最大输出上下文长度设置为 32K 令牌。本地模型使用 vLLM(Kwon 等, 2023)在四块 NVIDIA A100(80GB)GPU 上部署。我们使用种子 s=0,42,84,126,168 对每个样本运行五次评估。Reflect 执行四次反思迭代,即总共五次 LLM 调用,使用相同的种子 s。在每次运行的并行采样中,我们使用种子 s,s+1,...,s+4 采样五个输出。注意,Select 采样四个输出并使用种子 s 进行额外的基于 LLM 的选择调用,并且 LiteLLM 缓存(BerriAI, 2023)确保相同种子和输入产生相同的输出。
## 4 评估结果
图 4:六种模型中九种修订方法在 120 个样本测试集上的完成率。柱状图是五次不同种子的平均值,误差线是标准差。测试时计算方法(Reflect、or、and、maj、med 和 Select)使用五次 LLM 调用进行评估。
### 4.1 性能
图4 报告了六种 LLM 在测试集上九种修订方法的完成率,取五次运行的平均值。
#### 对话历史的重要性
在每个模型中,基线遵循一致的性能顺序:j+h > h > j。相似文章
运行还是不运行:分析基于LLM的程序修复中代码执行的成本效益
本文实证分析了基于LLM的程序修复智能体中代码执行的成本效益,发现执行被大量使用但往往不加区分,限制执行可以在对修复成功影响最小的情况下节省大量成本。
修订语境,转变模拟立场:审计基于LLM的在线讨论立场模拟
本文研究了基于LLM的在线讨论立场模拟如何对对话语境的反事实修订敏感,并提出了一个对比纯文本与多模态策略的审计框架。
@polynoamial: https://x.com/polynoamial/status/2064210146558136827
本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。
用 LLM 优化 LLM:面向测试时扩展的智能体发现方法
本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。
重采样不如精炼:LLM推理中的测试时自校正
一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。