为何自我纠正循环会降低大语言模型流水线的一致性(从85%降至62%)
摘要
在用于结构化数据提取的大语言模型流水线中添加自我纠正循环,导致一致性从85%下降到62%,原因在于复合噪声和再生漂移。文章探讨了潜在的解决方案,如细粒度差异机制或确定性门控。
在结构化数据提取中,添加一个LLM作为裁判的自我纠正循环通常被期望能提高准确性。实际上,我们的流水线显示了相反的结果:独立提取的得分约为85%一致性,但引入验证/重试循环后,一致性下降到62%或更低。架构与测试:模型设置:GPT-5.4在提取器和裁判的独立实例中使用。超参数影响:默认设置产生了低且不稳定的输出。(一致性低于35%)显式锁定temperature=0和reasoning_effort="none"将独立提取稳定在85%。循环:裁判实例检查原始源文本和提取的JSON以进行源跟踪。如果标记出任何问题,错误列表会反馈给提取模型以重新生成JSON。为何会退化:复合噪声:即使裁判评估中的微小差异也会触发严格的二进制验证门控,导致不必要的纠正运行。再生漂移:将错误笔记反馈到提示中会改变模型的令牌分布,导致它重新派生并突变它最初准确提取的字段。讨论:生产中的LLM系统如何处理自我纠正而不陷入提示漂移和复合错误循环?细粒度差异/补丁机制或基于确定性的规则门控是否比完全的LLM重新提示更可靠?
相似文章
LLM代理的一致性如何?在多步骤工具调用流程中测量行为可重现性
本文系统性地测量了LLM代理在多步骤工具调用流程中的行为可重现性,涉及1140条轨迹,发现了'结构一致性,参数变异性'的模式:代理可靠地按相同顺序选择工具,但参数有所不同,并且结构一致性能够预测任务的成功。
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines
This paper shows that LLM judges embedded in reasoning pipelines often make poor decisions, and proposes Evidence-Locked Derive–Gate–Repair (EL-DGR) to constrain judge overrides with evidence certificates, improving accuracy over majority vote and first-candidate baselines.
受控降解下的证据状态可靠性:多阶段LLM流水线中的解析器有效性偏离
本文引入证据状态可靠性(ESR)作为多阶段LLM流水线的评估层,表明在受控降解下,结构符合性可能提高,而证据敏感的阶段成功率则下降。
重复出现的 LLM 轨迹能否被合成为由类型化 ML 和 NLP 算子组成的确定性流水线?[D]
本文探讨了重复出现的 LLM 工作负载是否可以在适当情况下被自动合成的、由类型化 ML/NLP 算子组成的确定性流水线所替代,并征求关于可行性和方法的反馈。
重采样不如精炼:LLM推理中的测试时自校正
一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。