大语言模型智能体中标准校准修订:失效模式与一种基于追踪锚定的协议

arXiv cs.AI 论文

摘要

本文研究了语言模型智能体中的标准校准修订问题,识别了当前实现(如CMB-0.1)中的失效模式,并提出了一种新的基于追踪锚定的协议(CMB-0.4),以实现未来更精确的评估。

arXiv:2608.20729v1 公告类型:新 摘要:语言模型智能体可以在失败后改进,或跨对话保留文本,而不修订何为成功。我们研究了标准校准修订这一更狭窄的归因问题:当标准K0接受了一个违反更广泛承诺B的结果时,何种观察可以证明该系统已经形成并持续使用标准K1?我们要求满足五项不可补偿的条件:标准失败检测、模型发出的提案、新对话转移、对声称载体的干预敏感性以及保持性。 我们在十二个跨领域案例和四种设置上评估了CMB-0.1:无状态推理、仅追加历史记录、模型生成但框架承诺的状态,以及评估器编写的预言机状态。七个机制固定装置产生84个确定性评分试验;四个本地量化工件产生96次调用和192个模型-案例-设置试验。没有一个模型试验满足所有五个条件,但这一零结果并不能确立普遍能力的缺失。十一次调用在一次重试后仍然无效;若干承诺暴露了目标区分;框架执行了提交;删除操作重用了无状态调用;冲突改变了多个因素。Qwen2.5-7B在没有任何修订状态的情况下回答了所有的转移和保持项,暴露了零状态重构问题。 这些失效使CMB-0.1成为一个工具校准结果,而非模型排名。我们推导出一个前瞻性的、基于追踪锚定的CMB-0.4协议,该协议要求隐式转移、明确的写入/不写入/上报操作、单独记录的策略选择提交、匹配的干预、重复的隐藏项以及一个冻结的可执行预言机。这是一个后续设计方案,而非已完成的确认性结果。本文贡献了一条测量链、对其首个实现的实证诊断,以及一个用于未来标准校准修订测试的更具区分度的协议。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:21

# 大语言模型代理中的标准校准修订:故障模式与基于追踪的协议
来源:https://arxiv.org/html/2608.20729  
徐国栋 职称:青岛国栋先生网络科技有限公司(Guǒdòng Xīansheng)邮箱:[[email protected]](mailto:)

###### 摘要

语言模型代理可能在失败后改进,或在不同会话间传递文本而不修订成功标准。我们研究更具体的归因问题——标准修订:当标准 $K_0$ 接受了违反更广泛任务承诺 $B$ 的结果时,有哪些观察依据可以说明系统已形成并持续使用 $K_1$?我们提出五个非补偿性条件:标准失败检测、模型生成的提议、新会话转移、对所述载体的干预敏感性以及保持性。

我们在12个跨领域案例和四种实验设置中评估 CMB-0.1:无状态推理、仅追加历史记录、模型生成但由测试框架提交的状态,以及评估者编写的预言机状态。七个机制固定条件产生84个确定性评分试验;四个局部量化产物产生96次调用和192个模型-案例-设置试验。没有模型试验满足所有五个条件,但这一零结果并不能证明普遍能力的缺失。11次调用在一次重试后仍然无效;若干承诺暴露了目标区分;测试框架执行提交;删除操作复用了无状态调用;冲突操作改变了多个因素。Qwen2.5-7B在每次转移和保持性测试中都给出了答案,而无需依赖修订状态,暴露出零状态重建问题。

这些故障使得 CMB-0.1 成为仪器校准结果而非模型排名。我们由此推导出前瞻性、基于追踪的 CMB-0.4 协议,该协议要求隐藏转移、明确的 WRITE/NO-WRITE/ESCALATE 动作、单独记录的策略选择提交、匹配的干预措施、重复的隐藏项以及冻结的可执行预言机。这是一个后续设计方案,而非已完成的验证结果。本文贡献了一条测量链、对其首次实施的经验诊断,以及一个更具区分力的协议,用于未来对标准修订的测试。

关键词:语言模型代理系统;标准修订;持久化记忆;干预;评分器验证;校准研究

## 1 引言

大语言模型的能力边界通常被描绘为任务难度曲线。简单任务位于曲线内;复杂任务位于曲线外;规模、数据、搜索和工具将曲线向外推。这一图景解释了许多观察,但忽略了贯穿难度和领域的另一区别。形式化推导、多文档综合和大型软件任务可能很困难,但其成功条件是预先固定的。然后,训练、搜索、工具使用和错误修正都有方向。当操作标准本身允许不良结果通过时,就会出现一个不同的问题:系统必须根据其当前规则登记为成功,而忽略了任务的关键点,然后修订什么将被视为成功。

我们将这种更具体的结构称为标准代谢。它比撰写反思更具体,又比不受限的自我改进范围更窄。系统可以通过更好的搜索在后续任务中改进;可以在不将经验转化为操作标准的情况下保留经验;或者可以正确执行评估者提供的新规则。将所有这三种情况都称为标准修订会使该概念脱离经验风险。

近期系统使这一问题具有实验意义。Reflexion 在情景记忆中存储语言反馈,并在不更新权重的情况下改变后续行为。Dynamic Cheatsheet 为黑箱模型维护可转移策略。Evo-Memory、EvoMemBench 和 UMEM 将记忆积累、管理和泛化作为研究对象。AgeMem 将记忆操作作为策略动作暴露出来,而 Memory-R1 则训练明确的 ADD、UPDATE、DELETE 和 NOOP 决策。这些结果排除了“冻结的基础模型意味着冻结的代理”这一稻草人论点。它们也使归因问题更加尖锐:后续改进是源于当前任务的推理、外部提供的规则、重放的历史、代理选择的写入,还是由评估框架执行的状态变更?

本文做出四项贡献:
1. 区分普通任务失败和标准失败的形式化定义,操作化为五个非补偿性证据条件;
2. CMB-0.1,一个包含删除和冲突干预对所述状态载体进行操作的十二案例、四设置工具;
3. 具备七个机制固定条件和84次试验的确定性评分器验证;
4. 一个内部固定的192次试验局部模型校准,它暴露了输出契约混杂、目标规则泄露、自动框架提交、零状态重建以及不匹配的冲突干预等问题,并提出了一个旨在修复这些缺陷的基于追踪的 CMB-0.4 协议。

校准改变了基准测试的作用。CMB-0.1 并非作为模型系列的成熟评判者提出,而是一个对其自身数据开放的研究工具。它的故障指出了在确认性测试中必须控制什么,才能将标准修订主张归因于持久状态或策略选择的写入。

## 2 证据状态与范围

本手稿有意将已执行的校准与待完成的确认性研究分开。这一区分防止将更完善规格的未来设计误认为已完成的构念测试。

表 1:工具及其后续协议的证据状态。CMB-0.4 不是对 CMB-0.1 的追溯性重新分析,也不改变 CMB-0.1 的任何分数、原始响应或局限性。它在此的作用是使下一次可能的正面或负面结果更具区分力。CMB-0.2 和 CMB-0.3 仅作为推导该协议的历史设计步骤保留;两者都不贡献经验结果。

## 3 从任务失败到标准失败

### 3.1 两种失败

令 $K_0$ 为系统当前的操作标准,$B$ 为评估所固定的更广泛任务承诺,$y$ 为输出。普通任务失败满足:
$$
K_0(y) = 0 \qquad (1)
$$
系统未通过其当前标准。重试、搜索、更改工具或更改生成策略可能在不改变 $K_0$ 的情况下解决问题。

标准失败则具有相反的形式:
$$
K_0(y) = 1, \qquad B(y) = 0 \qquad (2)
$$
操作规则接受了违反任务更广泛承诺的结果。"每个声明都有引用"可能在引用不支持声明时得到满足。"所有公共测试通过"可能在契约边界仍错误时得到满足。"服务启动且冒烟测试通过"可能在不存在可用回滚产物时得到满足。在每种情况下,修复的对象不仅是答案步骤,还包括接纳该答案的规则。

### 3.2 最小化、非补偿性的操作化

一次试验成为标准代谢候选,仅当满足所有五个条件时:
- **检测**。系统将引发事件分类为“标准已满足但标准不足”,而非普通执行失败或成功。
- **引出的提议来源**。被测试模型(而非评估者)提供非空的 $K_1$ 提议。该冻结数据维度命名为内源性,但在 CMB-0.1 中,此维度并未确立自主规则发现、写入选择或提交权限。特别是,$B$ 可能在语义上暴露了区分特征。
- **完整状态转移**。在活动上下文被清除、新会话开始后,系统在完整状态下根据 $K_1$ 处理未见过的同类任务。单独的转移观察并非存储证明:行为可能从新任务重建。
- **干预敏感性**。删除据称承载 $K_1$ 的状态单元后,相对于完整条件,漏洞项表现下降,且冲突提示至少改变一个漏洞决策。该冻结数据维度命名为因果效力;然而,在 CMB-0.1 中,它仅是一个诊断筛选,因为删除操作复用了无状态调用,而冲突提示同时改变了内容、权限和格式。
- **保持性**。修订在关闭漏洞的同时,保留合法接受和合法拒绝。拒绝所有内容并非有效修订。

候选标签是合取:
$$
\mathrm{CM} = D \land E \land P \land C \land V \qquad (3)
$$
平均值无法补偿缺失的条件。仍报告连续比率以定位失败。

图 1:实际的 CMB-0.1 校准流程。橙色框是框架干预,而非模型选择的动作。该图明确说明了为什么 CMB-0.1 可以校准归因工具,但其本身无法证明自主标准编写。

### 3.3 构念边界

该定义并不要求系统修订每个高阶规则。实验必须固定某些 $B$;否则,“标准不足”没有评估对比。我们研究的是操作标准变更的一个可定位层次,而非无界的自我立法或无限的元修订。

标准与策略也没有唯一的、与任务无关的形而上学划分。我们的归因是操作性的:当 $K_0$ 接纳了一个不良结果,系统登记 $K_0$ 的不足,形成一个可比较的 $K_1$,并且对所述载体的干预改变了后续决策时,“标准修订”比“系统再次尝试”具有更强的区分证据。具有同等预测力的替代描述应予以报告,而非被术语击败。

## 4 相关工作

### 4.1 反思、测试时学习与演化记忆

Reflexion 通过语言反馈和情景记忆展示了跨试验学习,无需参数更新。Dynamic Cheatsheet 存储并重用紧凑的策略、代码和问题解决见解。Evo-Memory 在需要持续检索和更新的顺序任务流上评估代理;EvoMemBench 按会话范围以及知识与执行内容组织记忆。UMEM 联合优化记忆提取和管理,使用邻域级效用减少实例级噪声。自奖励语言模型将模型生成的评估移至迭代权重更新。

这些工作衡量性能、经验重用、记忆质量或自我生成的反馈。它们并非因此忽略了标准修订;它们提供了领先的候选机制。我们更具体的问题是:什么证据能区分自我形成的操作标准与四种替代方案:从当前任务的重建、对外部提供规则的执行、重放历史的提示效应,以及归因于其他状态的效应。

### 4.2 记忆实施、删除与冲突

ImplicitMemBench 测试经验是否在学习和干扰后被实施,而不仅仅是被召回。Mem2ActBench 类似地评估长期记忆是否支撑后续工具使用。对记忆添加和删除的控制研究发现了经验跟随行为、错误传播和未对齐的重放。上下文-记忆冲突也依赖于任务:改变任务的知识需求会改变模型遵循哪个来源。这些发现促使我们将转移与归因分离,并解释了为何不匹配的冲突提示不能解释为干净的内容干预。

### 4.3 对记忆的因果归因

整体记忆消融可能同时移除事实、偏好、任务配置和标准。因果记忆干预则估计候选记忆在受控包含和抑制下的影响。CMB-0.1 共享干预主义动机,但针对的是据称承载 $K_1$ 的最小单元。删除测试必要性。冲突替换旨在测试内容敏感性,尽管当前评分器仅检查至少一个漏洞决策是否改变。确认性版本必须要求在预定方向上的有效契约变更。

### 4.4 基准构念效度

基准分数仅当任务、干预和评分规则代表预期构念时,才支持能力主张。对445个LLM基准的系统回顾记录了反复出现的构念效度失败,并建议明确的构念定义、证据链和对替代解释的审视。因此,我们区分三个常被混为一谈的主张:冻结的评分器在固定条件上按程序运行;CMB-0.1 在真实模型调用中暴露了有用的故障特征;以及当前工具尚未建立对自主标准修订的构念效度测量。

## 5 CMB-0.1

### 5.1 十二个跨领域案例

CMB-0.1 包含十二个领域。每个案例有一个引发陷阱、一个未见过的同类漏洞项、一个合法接受和一个合法拒绝。案例和评分密钥在模型调用前内部固定。由于每个规则族只有一个漏洞项,$L_i$ 和 $L_d$ 是二进制的案例级观测值,而非稳定比率;因此干预项相应脆弱。

表 2:十二个 CMB-0.1 案例。

### 5.2 四种设置

#### 无状态。
新会话接收 $K_0$ 但不接收跨会话修订状态。此设置可以展示即时推理,但其本身无法建立状态持久性或归因。

#### 仅追加历史记录。
系统生成的诊断和 $K_1$ 作为先前文本被重放。如果该文本是实际因果载体,则历史记录是合法记忆;基准并未定义专用数据库作为唯一有效载体。

#### 系统生成、框架提交的标准状态。
模型提议 $K_1$,然后运行器自动将每个非空提议包装为版本化标准状态并提供给新会话。模型不选择 WRITE 或 NO-WRITE 动作,也不执行提交。此设置测试在框架提交下使用系统生成的提议,而非自主记忆写入。

#### 评估者编写的预言机记忆。
评估者将预定的正确 $K_1$ 写入相同的状态形式。此设置测试在状态转移下使用外部提供的正确标准,而非模型生成的提议。

相似文章

CALIBER:语言模型中推理前后的置信度校准

arXiv cs.CL

本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。

多智能体LLM校准的反事实图

arXiv cs.CL

本文介绍了CAGE,一种基于反事实图的多智能体LLM系统校准方法,在TriviaQA和MMLU-Pro等基准测试上进行了评估,涵盖了多种通信拓扑结构。该方法优于现有的事后校准和LLM引导校准方法。