SAGE:基于状态、弃权感知的任务导向对话智能体评估
摘要
SAGE是一种新颖的任务导向对话智能体评估框架,它将评估基于对话状态变化,并使用弃权机制来提供成本效益高、准确的回合级判断,无需昂贵的LLM调用。
arXiv:2609.00434v1 公告类型:新
摘要:评估任务导向对话智能体不仅需要判断回复是否读起来好,还需要判断每个回合是否正确推进了底层工作流状态——这是传统整体LLM评判器可能忽略的区别,因为它们将可用上下文作为一个整体来评估,并且每个回合需要一个或多个完整模型调用。我们提出SAGE(基于状态、弃权感知的评估),它将工作流规范和每回合状态差异编译为原子的、基于模式的标准,并将每个标准路由到符号和编码器/NLI验证器的级联中,这些验证器选择弃权而非猜测,将标准判决聚合为带有证据追踪的回合级决策。其推荐的操作点SAGE-Core仅使用编译器、符号规则和设备上编码器决定81-91%的标准——零付费LLM成本——而SAGE-LLM为开放类标准添加了可选的聚焦LLM回退机制。在涵盖MultiWOZ、Schema-Guided Dialogue和ABCD的四个切片中,没有评估过的LLM-as-a-judge基线——包括状态感知的GPT-4.1评判器和更便宜的GPT-4.1-mini变体——在任何切片上显著超越SAGE-Core,尽管GPT-4.1 G-Eval评判器每1000回合成本为4.7-8.0美元,而SAGE-Core为0美元。一项双标注者人类审核(n=200,κ=0.94)确认了在转录可见故障类上的强标签保真度——其中,排除弱显著性IUV类,SAGE-Core在统计上与最强的LLM评判器持平——并将忽略用户价值诚实地界定为具有弱广泛人类显著性的状态一致性信号。我们分析了从注入故障和部分符号循环性中得出的构念效度限制。
查看缓存全文
缓存时间: 2026/09/02 06:02
# SAGE:基于状态的、弃权感知的对话任务智能体评估方法
来源:https://arxiv.org/html/2609.00434
###### 摘要
评估面向任务的对话智能体不仅需要判断回复是否通顺,还需要判断每个轮次是否正确推进了底层工作流状态——这是一个传统整体式大语言模型评判器可能遗漏的区别,因为它们将可用上下文作为一个整体进行评估,且每个轮次需要一次或多次完整的模型调用。我们提出SAGE(**基于状态的弃权感知评估**),该方法将工作流规范和每轮状态差异编译为原子化的、基于模式的标准,并将每条标准路由通过符号验证器和编码器/自然语言推理验证器的级联,这些验证器会选择**弃权**而非猜测,最后将各标准的裁决聚合为带有证据轨迹的轮次级决策。其推荐操作点SAGE-Core仅使用编译器、符号规则和本地编码器,就在零付费大语言模型成本下,解决了81-91%的标准判定。而SAGE-LLM则为开放类别标准增加了可选的聚焦式大语言模型回退机制。在覆盖MultiWOZ、模式引导对话和ABCD数据集的四个切片上,所有被评估的大语言模型评判基线——包括一个状态感知的GPT-4.1评判器和更便宜的GPT-4.1-mini变体——均未在任何切片上显著超越SAGE-Core,即使GPT-4.1 G-Eval评判器的代价是每1000轮4.7-8.0美元,而SAGE-Core的成本为零。双标注者人工审计(n=200,κ=0.94)确认了在转录可见失败类别上的高标签保真度——其中,排除弱显著性的IUV类别后,SAGE-Core在统计上与最强的大语言模型评判器表现持平——并将被忽略的用户价值作为状态一致性信号进行诚实地限定,其广泛的人类显著性较弱。我们分析了因注入失败和部分符号循环性导致的建构效度局限。
微软 \{rayankhoury, shihyaolin, pmishra\}@microsoft.com
## 引言
参见说明图1:一个流畅且切题但工作流上错误的智能体轮次:用户要求预订*牛津*,但智能体确认了*剑桥*且未记录book\_people,因此状态差异ΔtΔ_{t}以三种方式违反了工作流。仅基于转录的整体式大语言模型评判器可能将该轮次评为*可接受*;而SAGE则将工作流规范W\mathcal{W}和每轮状态对(st-1,st)(s_{t-1},s_{t})编译为原子标准(UV、IUV、PC),将每条标准路由至最经济的判定阶段(S1符号、S2编码器/自然语言推理、可选的S3聚焦式大语言模型),并在零付费API成本下返回带有每标准证据轨迹的*失败*裁决。
图2(https://arxiv.org/html/2609.00434#Sx3.F2)展示了完整流程。面向任务的对话(TOD)智能体越来越多地处理结构化业务工作流——预订、支持、工单——其正确性更多取决于智能体如何改变底层*对话状态*,而非其说了什么。遵循对话状态追踪传统(Budzianowski et al. 2018 (https://arxiv.org/html/2609.00434#bib.bib4); Rastogi et al. 2020 (https://arxiv.org/html/2609.00434#bib.bib7)),将第t轮前后的槽值记录记为st-1s_{t-1}和sts_{t},并将每轮*状态差异*记为Δt=diff(st-1,st)Δ_{t}=\operatorname{diff}(s_{t-1},s_{t})(已更改槽的三元组集合;在方法部分形式化);仅当ΔtΔ_{t}满足四个条件时,工作流才正确推进——用户提供的值被写入状态,智能体请求的下一个字段符合模式合法,确认仅在其前提条件满足时发生,且每个写入的值都有对话历史支持。
图1(https://arxiv.org/html/2609.00434#Sx1.F1)说明了其重要性:在一个流畅切题但写入了未支持的值、在前提条件满足前进行确认、并丢弃了用户刚提供的值的轮次上,整体式大语言模型评判器会标记为可接受,而基于状态的评估器通过读取ΔtΔ_{t}并以确定性的、带有证据的裁决捕获失败。
然而,多轮大语言模型智能体评估的主流范式仍是*整体式大语言模型评判器*:一个强大的模型阅读转录文本,并通过直接评分(Zheng et al. 2023 (https://arxiv.org/html/2609.00434#bib.bib3))或评分token概率加权评分(G-Eval)(Liu et al. 2023 (https://arxiv.org/html/2609.00434#bib.bib2))返回单一可接受性分数。对于有状态的TOD,这种范式在结构上是不匹配的:它*混淆了流畅性与工作流正确性*(一个措辞恰当但未能记录用户刚提供值的轮次会被评为可接受);它*对规范视而不见*(过早确认需要评估结果谓词O(st-1)\mathcal{O}(s_{t-1}),而仅基于转录的评判器原则上无法获取st-1s_{t-1});并且它是*单片式的*(每个轮次都花费一次完整的大语言模型调用,即使对ΔtΔ_{t}进行确定性检查就能解决)。
SAGE(**基于状态的弃权感知评估**)用一个*编译器*取代了整体式评判,该编译器消费工作流规范W=(S,F,≺,O)\mathcal{W}=(\mathcal{S},\mathcal{F},\prec,\mathcal{O})——包括模式S\mathcal{S}、具有合法排序关系≺\prec的必要字段F\mathcal{F},以及结果谓词O\mathcal{O}——并结合历史记录h。789.859{\>} .789);即便如此,它也仅与SAGE-Core持平(SGD + .005{+}.005, p=.83p{=}.83;UV-rich + .019{+}.019, p=.46p{=}.46),并在多类别切片上落后(MW-mixed + .107{+}.107, p=.001p{=}.001;ABCD + .152{+}.152, p<.001p{<}.001)。因此,在所有四个切片上,无论是预指定的套件还是更便宜的基座迷你评判器,*没有被评估的大语言模型评判基线显著超越SAGE-Core*(附录D (https://arxiv.org/html/2609.00434#A4))。
聚焦式大语言模型层级并非关键,信息访问也无法解释差距。启用S3(SAGE-LLM)从未提高F1F_{1},并在UV-rich和ABCD上轻微降低,因此我们推荐SAGE-Core(逐层消融,附录F (https://arxiv.org/html/2023.123456789#A6))。将SAGE使用的相同模式/状态块提供给GPT-4.1评判器会*降低*其F1F_{1}高达0.090.09(在我们的提示模板中;该效果在SGD上使用迷你基座时反转;附录D (https://arxiv.org/html/2609.00434#A4)),因此优势并非仅源于信息访问。按类别看,SAGE-Core几乎捕获了所有UV(59/61 MW-mixed,98/98 SGD,95% UV-rich)并饱和了PC/WNF的召回率,但对IUV触发不足(16/32 MW-mixed,18/41 SGD)——这是我们通过人工审计重新审视的类别。
我们基于建构理由对ABCD提出告诫:其大多数标准由S1/S2谓词决定,这些谓词部分镜像了注入算子(讨论部分),因此它证明的是对设计失败的恢复能力,而非对野生环境的检测能力。
附加分析。附录报告了逐方法的精确率/召回率/成本/延迟表(附录B (https://arxiv.org/html/2023.123456789#A2)),展示了S2承载精确率下限且SAGE-Core(S1+S2)在每个切片上匹配或超越完整级联的逐层消融(附录F (https://arxiv.org/html/2023.123456789#A6)),级联成本剖析(81-91%的标准在零API成本下决定;附录G (https://arxiv.org/html/2023.123456789#A7)),校准的选择性评估(附录H (https://arxiv.org/html/2023.123456789#A8)),以及SGD-X释义鲁棒性(裁决σ=0.002σ{=}.002 vs. 0.0050.005–0.0150.015对于大语言模型评判器;附录I (https://arxiv.org/html/2023.123456789#A9))。
## 人工验证审计
我们的基准测试使用了注入失败,因此评估器可能是在恢复合成扰动,而非人类有意义的工作流错误。我们对分层n=200n{=}200的样本进行了盲审:100个覆盖所有四个类别的注入失败(MW-mixed + SGD),50个金标准-干净轮次,以及50个ABCD + UV-rich示例。两名标注者在不知道注入标签和任何模型裁决的情况下,独立地根据对话历史、*状态对*(st-1,st)(s_{t-1},s_{t})和智能体响应,将每个轮次标记为可接受/失败;他们意见不一致的3%3%轮次从共识集中移除。可靠性很高(原始一致性0.970.97,Cohen’s κ=0.939κ{=}.939(Cohen 1960 (https://arxiv.org/html/2023.123456789#bib.bib30));协议和表格随代码发布)。
#### 标签保真度。
在共识集(n=194n{=}194;从200个采样轮次中移除6个因标注者不一致)上,人类在158/194=0.814158/194{=}0.814的轮次上与注入的金标准标签一致(Cohen’s κ=0.639κ{=}.639),在ABCD + UV-rich子集上达到*完美*一致。每个转录可见类别的一致性都很高——PC 1.001.00,UV 0.950.95,WNF 0.730.73(表2 (https://arxiv.org/html/2023.123456789#Sx6.T2))——支持了建构效度:这些扰动被视为真实的失败,而非标签噪声。WNF最弱(0.730.73),与MultiWOZ的部分槽排序一致,这也使得符号验证器触发保守;因此两个独立信号同意WNF比其他约束更宽松。
#### IUV类别。
唯一尖锐的分歧在IUV(被忽略的用户价值):人类仅在1/301/30轮次上认可注入标签,且3535个注入轮次中的人类-注入分歧有2929个是IUV(第36个共识集分歧是一个人类标记为自然失败的金标准-干净轮次;见下文)。这不是标签噪声——注入通过设计可验证(用户提供的值从sts_{t}中删除)——也不是仅基于转录的产物:标注者*看到了*状态对,但我们的协议未明确他们是未执行utu_{t}与sts_{t}逐槽对账(这将显现遗漏),还是执行了但未将丢弃的值视为失败。因此,检测是方法依赖的,并与精确率权衡,且没有评估器占据主导地位(每个评估器的计数见附录K (https://arxiv.org/html/2023.123456789#A11));SAGE-Core处于高精确率端。因此,我们将IUV视为一个*标签*可验证但*广泛人类建构对齐度*较弱的类别,不声称SAGE-Core是唯一能检测它的方法。
#### 与人类判断的一致性。
将人类共识视为基准,SAGE-Core在所有审计轮次上达到F1=0.825F_{1}{=}0.825,而最强被评估的大语言模型评判器(仅转录的G-Eval)为0.9040.904;对所有n=194n{=}194审计轮次的配对自举法确认这是一个显著缺陷(ΔF1=−0.079ΔF_{1}{=}{-}0.079,95%95% CI [−0.142,−0.019][{-}0.142,{-}0.019],p=0.01p{=}0.01)。差距几乎完全集中在IUV:在转录可见子集(n=164n{=}164)上,SAGE-Core达到0.9090.909,而最强评判器为0.9200.920,配对自举法无法区分此差异与零(ΔF1=−0.011ΔF_{1}{=}{-}0.011,p=0.68p{=}0.68)。
诚实的解读并非SAGE-Core是人类判断的更好代理;而是,在不包括IUV的转录可见失败类别上,它在统计上与最强的大语言模型评判器持平,且成本为零,而其整体缺陷反映了仅状态相关的IUV类别上人类标签本身较弱。关键的是,主要结论对剔除这个争议类别具有鲁棒性:移除所有注入IUV轮次后重新运行预指定的配对自举法,所有裁决保持不变,并*扩大*了两个优势(MW-mixed ΔF1=+0.152ΔF_{1}{=}{+}0.152,SGD +0.149{+}.149,均p<0.001p{<}0.001)。
在50个干净轮次中,标注者标记了一个自然发生的失败(SAGE-Core遗漏了它);由于n=1n{=}1,我们无法得出结论,只能指出更大的自然失败研究仍是实现更完整外部效度的最清晰路径。
表2:人工验证审计(n=200n{=}200轮次,两名标注者对注入标签和所有模型裁决保持盲态;标注者看到转录文本、状态对和智能体响应)。上:可靠性与标签保真度。中:在MW-mixed + SGD上,各类别人类与注入标签的一致性。下:与人类共识的一致性(F1F_{1}),总体及在转录可见子集上(不包括仅状态的IUV类别)。
## 讨论
#### 为何状态接地是必要的但非充分的。
与预期相反,状态感知的G-Eval在MultiWOZ上*弱于*仅转录的G-Eval(F1F_{1} 0.8340.834 vs. 0.9230.923,表4 (https://arxiv.org/html/2023.123456789#A2.T4)),在SGD上持平,且状态感知的大语言模型评判器过度标记了ABCD的简洁文本(表1 (https://arxiv.org/html/2023.123456789#Sx5.T1)):额外的上下文似乎将整体式1-5分锚定在sts_{t}的一致性上,而非ata_{t}的支持度上。这具有提示敏感性,而非普遍规律——使用agpt-4.1-mini基座时,该效果在SGD上*反转*(状态上下文*有帮助*,+0.070{+}.070;附录D (https://arxiv.org/html/2023.123456789#A4))。
现存的、可辩护的主张更窄但稳健:即使是信息最充分、基座最强的整体式评判器也未显著超越SAGE-Core(表6 (https://arxiv.org/html/2023.123456789#A4.T6))。因此,SAGE与基线的差距与以下方面一致——但非其证明——即来自逐标准分解、级联通由和弃权感知聚合的架构优势,即*改变评判单元*而非看到更多上下文。
#### 更便宜基座的基线。
我们的G-Eval风格评判器的n=6n{=}6采样配置(Liu et al. 2023 (https://arxiv.org/html/2023.123456789#bib.bib2))是顺序的,导致其≈14\approx 14–44倍44\times延迟倍增。为排除SAGE的优势是昂贵GPT-4.1基座模型类产物的可能性,我们在两种提示模式下,使用≈5\times约5倍(在匹配token使用量下)更便宜的gpt-4.1-mini重新运行了G-Eval,成本为每1k $0.9–1.6,而GPT-4.1为每1k $4.7–8.0(附录D (https://arxiv.org/html/2023.123456789#A4))。
这个便宜的评判器在SGD上超过了我们预指定的FrugalGPT基线,但仅在那里*与*SAGE-Core持平,并在MultiWOZ上保持低于它;表1 (https://arxiv.org/html/2023.123456789#Sx5.T1)中的单次调用大语言模型评判器是一个进一步降低成本的点,SAGE匹配或领先。在任何测试预算下,没有被评估的评判器显著超越SAGE-Core,而后者成本为零。
#### 符号注入循环性,以及什么是非循环的。
对于三个类别(WNF、PC、IUV),注入算子和S1共享谓词(例如,当状态写入confirmed且必要字段未填充时注入PC,这正是S1的触发条件);SAGE在符号层面以近零成本获胜之处(特别是ABCD上的S1+S2),主要是在符号可判定的子集上反向操作其自身的注入器,我们将这些数字读作编译器*恢复了其设计用于检测的失败形式*。UV更接近非循环:检测运行一个现成的DeBERTa-v3自然语言推理步骤(cross-encoder/nli-deberta-v3-base),它不共享符号谓词,尽管注入的值仍被选择为自然语言推理可检测的,因此这仍是建构性的而非完全野生的。SAGE在MultiWOZ(SAGE-Core 0.970.97,SAGE-LLM 0.980.98)和ABCD(0.9510.951/0.9610.961)上的UV召回率是检测能力的最强外部证据。
#### 局限性。
SAGE需要工作流规范,不适用于开放式聊天。MultiWOZ的部分必要字段排序导致S1触发保守(23%误报率);SGD的主要失败是值规范化不匹配(IUV召回率0.440.44);在ABCD上,5/1035/103真实失败未被...相似文章
SAAG:结构化智能体评估与基础验证
SAAG提出了一种级联诊断框架,用于评估LLM智能体函数调用,通过将评估分解为注册一致性、结构完整性和参数基础验证三个阶段,实现可解释的诊断和迭代自我修复。在sub-4B模型上的实验表明,与单次评估相比,参数精度得到提升,值幻觉减少。
Dialogue SWE-Bench:对话驱动编码代理的基准测试
提出了 Dialogue-SWE-Bench,这是一个用于评估编码代理通过与用户对话解决软件工程问题能力的基准测试。该研究还提出了一种基于角色设定的用户模拟器和一个能够提升对话能力的模式引导型代理。
SAGEAgent: 用于多模态生存预测中成本感知模态获取的自进化智能体
SAGEAgent 是一种基于LLM的临床智能体,它依次决定为癌症患者获取哪些诊断模态,以平衡预测准确性与临床侵入性,在将获取负担降低55%的同时,保持具有竞争力的生存预测性能。
Agri-SAGE:基于仿真的多智能体大语言模型用于上下文感知的农业咨询生成
本文介绍了Agri-SAGE,这是一个闭环框架,将多智能体大语言模型推理与生物物理模拟(APSIM)相结合,以生成并验证上下文感知的农业建议。在回顾性分析中,该框架优于静态基线,其中Tree-of-Thoughts实现了峰值产量,而Reflexion通过情景记忆降低了计算成本。
SKG-Eval:基于增量语义知识图谱的多轮对话状态化评估
提出SKG-Eval,一种用于多轮对话的准确定性评估框架,利用增量语义知识图谱检测跨轮不一致性、矛盾及主题漂移,实现与人类判断更高的相关性。