τ-Elicitation:评估语音代理中多轮实体提取的基准
摘要
本文介绍了τ-Elicitation,一个用于评估语音代理中多轮实体提取的基准,指出了策略选择和错误恢复是关键瓶颈。
arXiv:2609.13602v1 Announce Type: new
摘要:语音代理通常需要精确收集姓名、地址、标识符、日期和时间,但端到端基准测试掩盖了捕获失败的位置。我们介绍了τ-Elicitation,一个涵盖10种实体类型的200项任务语音基准,具有受控难度、呼叫者现实性和三种环境。匹配的文本代理通过了所有任务,但四种语音配置从0.14到0.41实现了稳健的精确成功。代理对困难和不熟悉的实体增加了验证,有时对不正确的捕获也增加验证,但对其最弱的呼叫者声音没有;只有24%到37%的验证错误被修复。一个规定了拼写、回读、纠正和确认的支架将稳健的Pass$^3$提高了14到31个点,每次通话成本为21到28秒。诸如拼写变体和重启之类的现实性没有明显影响精确成功;发音错误增加了修复努力。这些结果指出了策略选择和成功恢复是精确语音实体收集的核心瓶颈。
查看缓存全文
缓存时间: 2026/09/15 08:57
# TAU-ELICITATION:语音代理多轮实体抽取基准测试
来源:https://arxiv.org/html/2609.13602
###### 摘要
语音代理通常需要精确收集姓名、地址、标识符、日期和时间等信息,然而端到端基准测试无法明确捕捉失败环节。我们提出了τ-Elicitation,这是一个涵盖10种实体类型、具有可控难度、呼叫者真实性模拟和三种环境条件的200任务语音基准测试。一个匹配的文本代理能完成所有任务,但四种语音配置仅在0.14–0.41的范围内实现稳健的精确成功率。代理会为困难和不熟悉的实体增加验证,有时也为错误捕获增加验证,但不会为最弱的呼叫者语音增加验证;仅有24–37%的已验证错误得到修复。一种规定了拼写、回读、纠正和确认流程的脚手架方案,将稳健通过率\( \mathrm{Pass}^{3} \)提高了14–31个百分点,但每次通话增加了21–28秒的时间成本。诸如拼写变体和重新开始等真实性因素并未显著影响精确成功率;而发音错误则增加了修复难度。这些结果表明,策略选择和成功恢复是精确口语实体收集的核心瓶颈。
###### 索引术语:
语音代理,口语对话评估,多轮实体抽取,对话修复,面向任务的对话
††地址:1Sierra 2Mercor
[email protected] Soham Ray¹ Victor Barres²
## 1 引言
语音代理基准测试通常评估完整任务的完成情况\[12 (https://arxiv.org/html/2609.13602#bib.bib1), 4 (https://arxiv.org/html/2609.13602#bib.bib2), 3 (https://arxiv.org/html/2609.13602#bib.bib3)\],但身份验证和关键实体转录仍然是常见的失败点。现有工作未能单独评估交互式代理是否能够识别不确定的捕获、决定何时降速、修复错误并存储精确值,也未衡量这种能力如何随实体类型、难度、重复条件或呼叫者努力程度而变化。这一点很重要,因为误解的命名实体会阻碍口语对话,而确认每个属性本身也可能让呼叫者感到沮丧\[7 (https://arxiv.org/html/2609.13602#bib.bib21)\]。
τ-Elicitation 针对关于缺失数据库字段的简短回拨任务测试了这项能力。每个核心任务引导一个缺失值,隔离了口语实体收集的基本单元,并为更广泛的呼叫建立了最低复杂度基准;随后关联的多实体任务测试错误如何累积。其默认提示定义了*代理主导*条件:记录必须完全正确,建议在不确定时进行逐字母验证,但由代理决定何时以及如何验证。而匹配的*脚手架*条件则规定了询问、拼写或回读、确认、纠正和提交的流程。两者共享同意、不猜测、日志记录和单次提交规则,将策略选择与协议执行分离开来。使用确定性数据库比较对两种条件进行评分,无需LLM评判者。
我们贡献了一个可复现的200任务基准测试,涵盖10种实体类型,具有受控的难度和呼叫者真实性模拟,以及多实体通话。它在三种环境中测量了捕获、验证、修复、努力程度和稳健成功率;代码和制品已发布在GitHub上 (https://github.com/sierra-research/tau2-bench/blob/tau-elicitation/papers/tau-intake/v1/reproduction/README.md)。
图 1:τ-Elicitation 从实体库中选择数值,构建受控任务,并通过 τ-Voice 交互循环运行。 \(\mathrm{Pass}^{3}\) 要求在三种环境实现中均成功。刻度表示对代理语音保真度的评判。
## 2 相关工作
表 1:相关基准测试覆盖范围。任务:已执行的工具任务;精确:精确实体评分;NN:受控实体数量;D:诊断或部分覆盖。| 工作 | 多任务 | 精确 | NN | 修复 | 语音代理 |
| :--- | :---: | :---: | :---: | :---: | :---: |
| \[12, 4, 3, 9\] | ✓ | ✓ | D | – | D |
| \[14, 21\] | ✓ | – | ✓ | – | – |
| \[13, 20, 1\] | – | – | ✓ | – | – |
| τ-Elicitation | ✓ | ✓ | ✓ | ✓ | ✓ |
现有语音代理基准测试——τ-Voice、EVA-Bench、DuplexWorld 和 Full-Duplex-Bench-v3——衡量端到端任务性能和交互质量;其中一些也测试工具使用情况\[12 (https://arxiv.org/html/2609.13602#bib.bib1), 4 (https://arxiv.org/html/2609.13602#bib.bib2), 3 (https://arxiv.org/html/2609.13602#bib.bib3), 9 (https://arxiv.org/html/2609.13602#bib.bib6)\]。它们广泛的范围揭示了诸如身份验证等失败点——这被确定为 τ-Voice 中的主要瓶颈,并在 EVA-Bench 中有单独报告——但并未孤立精确实体捕获问题\[12 (https://arxiv.org/html/2609.13602#bib.bib1), 4 (https://arxiv.org/html/2609.13602#bib.bib2)\]。τ-Elicitation 延续了 τ-bench、τ²-Bench 和 τ-Voice 的脉络,将受控的语音实体收集作为主要任务\[19 (https://arxiv.org/html/2609.13602#bib.bib5), 2 (https://arxiv.org/html/2609.13602#bib.bib4), 12 (https://arxiv.org/html/2609.13602#bib.bib1)\]。
对话状态追踪涵盖 MultiWOZ、SpokenWOZ 和跨话语子槽追踪\[5 (https://arxiv.org/html/2609.13602#bib.bib7), 14 (https://arxiv.org/html/2609.13602#bib.bib10), 21 (https://arxiv.org/html/2609.13602#bib.bib11)\]。ASR 和口语实体相关工作包括自然语音 NER、ASR 错误传播、合成音频中的未见实体以及工业环境中的实体遗漏率\[13 (https://arxiv.org/html/2609.13602#bib.bib8), 15 (https://arxiv.org/html/2609.13602#bib.bib12), 20 (https://arxiv.org/html/2609.13602#bib.bib13), 1 (https://arxiv.org/html/2609.13602#bib.bib9)\]。《口语对话系统中的错误检测与恢复》研究了修复策略\[7 (https://arxiv.org/html/2609.13602#bib.bib21)\]。没有一项工作结合了实时工具执行、精确数据库写入、受控的实体类型、难度和数量,以及代理是否选择进行验证。表 1 (https://arxiv.org/html/2609.13602#S2.T1) 总结了这一空白。
## 3 方法
### 3.1 任务与引导策略
每个任务是一个关于具有缺失字段记录的回拨电话。代理看到字段名称,向呼叫者询问其值,记录捕获内容,并提交一次;呼叫者仅在请求后才透露值。模拟呼叫者是合作性的:它提供请求的值,被要求时准确拼写,并确认或纠正回读,但从不主动提供信息。
### 3.2 数值、难度与真实性
十个库各包含40个容易和40个困难的数值;基准测试从每个库中各抽取10个不同难度的样本。难度是类型相对的:例如,困难的姓名更罕见,困难的代码更长或易混淆,困难的电子邮件包含更多符号。表 2 (https://arxiv.org/html/2609.13602#S5.T2) 报告了库构建和性能。
通过向呼叫者提示追加脚本化指令,种子目录添加了六种呼叫者真实性。例如,一种拼写风格指令告诉呼叫者在拼写数值时将字母 Z 说成“zed”。自我修正提供一个错误数值并立即修复;拼写变体改变字母或数字的分组方式;结巴并重新开始拼写在字符串中途引入修正;部分答案和错误字段答案需要后续澄清;而审查过的发音错误仅改变音频。条件性行为仅在对话创造机会时发生,因此例如拼写纠正无法在拼写开始前触发。每个任务存储其生成器和目录版本、种子、选定的真实性和预期数据库状态。生成器还生成关联的两个和三个字段任务,既有扁平通话形式,也有在揭示下一个字段之前验证一个字段的分步工作流程。
### 3.3 评分与行为测量
我们将每个最终数据库数值与精确的黄金字符串进行比较,并将常规实现的成功报告为 Pass@1。我们将稳健通过率 \(\mathrm{Pass}^{3}\) 定义为在三个预先指定的环境实现中——*常规*;*重噪声*,带有10 dB背景噪声、突发噪声、丢帧和闷音;以及*重语音*,带有打断、反馈词和重新开始——相同任务的精确成功。与重复试验得分不同,\(\mathrm{Pass}^{3}\) 跨越这些预先指定的条件;语音和真实性分配也会重新抽取。因此,它询问的是同一任务是否稳健成功,而非平均掉某一条件下的失败。一项700通电话的审计将第90百分位数持续时间定为1.89分钟,因此我们使用保守的四分钟限制。超时通话保留在分母中,得分为零。
我们对捕获的第一个值和最终数据库值都与黄金字符串进行评分。静默呼叫者工具记录每个拼写请求和回读;其总和是我们的验证工作量度量。我们在噪声、实体难度和熟悉度、以及每个系统最佳和最差表现呼叫者语音之间比较这种工作量。
## 4 实验
系统。我们评估了 gpt-realtime-2(minimal 和 xhigh 推理)、gemini-3.1-flash-live-preview(high)和 grok-voice-think-fast-1.0(提供者默认)\[11 (https://arxiv.org/html/2609.13602#bib.bib14), 8 (https://arxiv.org/html/2609.13602#bib.bib15), 18 (https://arxiv.org/html/2609.13602#bib.bib16)\]。呼叫者使用 gpt-5.5(xhigh,温度为零)\[11 (https://arxiv.org/html/2609.13602#bib.bib14)\],语音由 ElevenLabs eleven_v3 合成\[6 (https://arxiv.org/html/2609.13602#bib.bib17)\]。
匹配运行。每种配置在常规、重噪声和重语音条件下运行所有200个任务。我们使用规定拼写和回读行为的脚手架提示重复此网格。在每种条件下,系统使用相同的任务和随机种子。这给出了每个配置600个代理主导和600个脚手架通话,总计4800次通话。
不确定性与显著性。置信区间来自10,000个任务级引导样本。当一个任务被抽样时,其三个关联条件保持不变。成对系统测试也按任务对齐通话。我们使用双边符号排列检验,具有100,000次排列和标准的+1校正。Holm校正分别应用于 Pass@1 和 \(\mathrm{Pass}^{3}\) 的六个系统比较。
人类与评判者验证。两名评估者独立审查跨提供者的90次失败通话,标记失败来源和子类型。经过讨论和六次明确裁决,86通电话的失败来源得到解决,81通被归为代理失败的电话中有66通的子类型得到解决。对于保真度验证,gemini-3.1-pro-preview(温度为零)对一份包含丰富人类标记的、分层的60话语样本进行评分\[8 (https://arxiv.org/html/2609.13602#bib.bib15)\]。
## 5 结果
图 2:组合任务集上的任务成功率。每对显示代理主导和脚手架运行;浅色全柱显示 Pass@1,深色内嵌柱显示稳健 \(\mathrm{Pass}^{3}\)。
### 5.1 策略选择与稳健性
- • 脚手架以时间换可靠性。它将 Pass@1 提高了15–37个百分点,将 \(\mathrm{Pass}^{3}\) 提高了14–31个百分点(图 2 (https://arxiv.org/html/2609.13602#S5.F2)),同时每次通话增加了21–28秒。增益对于困难实体略大(27点 vs 23点)。
- • 提供的协议缩小了提供者差距。Grok 仍然最佳,并在两个指标上显著超过所有其他代理主导系统(Holm校正后 \( p \leq .0032 \));没有其他配对存在差异。系统执行提供的协议比独立选择协议更可靠。
- • 稳健性暴露了不稳定性。跨系统,\(\mathrm{Pass}^{3}\) 在代理主导条件下跨度为14–41%,在脚手架条件下为37–54%。排名可能逆转:Gemini 在常规 Pass@1 上击败 GPT xhigh(51.5% vs 44.5%),但在 \(\mathrm{Pass}^{3}\) 上落后(13.5% vs 20.0%)。
- • 多样化的环境比随机重复运行揭示更多问题。对于脚手架化的 GPT xhigh,三次常规运行具有相似的 Pass@1 率(74.5%、75.5% 和 77.0%),但仅有103个任务(200个)在每次重复中都通过(\(\mathrm{Pass}^{3}\) = 51.5%):86个任务至少改变一次结果。将两次重复替换为重噪声和重语音条件,将三次全通过的数量降至77个(38.5%)。因此,环境多样性揭示了随机重复运行之外的不稳定性,单次成功高估了可靠性。
- • 更多推理并未持续改善稳健性。从 minimal 到 xhigh,\(\mathrm{Pass}^{3}\) 在代理主导条件下从15.0%上升到20.0%,但在脚手架条件下从45.5%下降到38.5%。
### 5.2 风险识别与恢复
GPT xhigh 字段的初始捕获错误率为69%,Gemini 为65%,Grok 为42%。GPT 和 Gemini 对66%和64%的错误捕获进行验证,而对正确的捕获验证率为50%;Grok 几乎验证所有内容(94%/96%)。系统同样在困难和不熟悉的实体上花费更多精力,但对其自身最弱的呼叫者语音并非如此,并且只有 Grok 对噪声做出反应(图 3 (https://arxiv.org/html/2609.13602#S5.F3))。风险识别是真实但不完整的。
图 3:平均验证工作量(回读加上拼写请求)。所有系统都为困难和不熟悉的实体增加工作量,但对其自身最低 Pass@1 的呼叫者语音并非如此;只有 Grok 在噪声下增加工作量。
在已验证的 GPT xhigh、Gemini 和 Grok 错误中,只有27%、37%和24%最终得到正确结果。在347个最初错误的捕获中,无修复步骤的恢复率为10%,仅回读为26%,仅拼写为24%,两者兼有为35%。由于代理选择何时验证,这些是关联性的,但该模式将瓶颈定位在风险被注意到之后。代理常常坚持错误或虚构一个替代值,而不是完成修复。
呼叫者语音是另一个盲点。在代理主导的常规通话中,每个系统最佳和最差表现语音之间的差距对于 GPT xhigh 是27点,Gemini 是28点,Grok 是15点。排序并不稳定:Mildred 在 GPT xhigh 和 Grok 中领先,而 Wei 在 Gemini 中领先。只有 Gemini 有证据表明,在校正后,所有五个语音之间的成功率存在差异(\( p=.040 \));没有单个 Gemini 语音配对保持显著,因此该结果确立了异质性但未隔离出一个特定对比。跨系统,Mildred 显著超过 Priya、Mamadou 和 Arjun,但不超 Wei。然而,没有系统为其自身表现最差的语音增加验证,这表明代理不会根据语音特定的难度调整其工作量。
### 5.3 压力测试与诊断
呼叫者真实性主要增加修复成本。没有指定的真实性在任一支路中显著改变精确成功率(图 4 (https://arxiv.org/html/2609.13602#S5.F4))。总体 Hájek 估计值在代理主导条件下为 -3.6 点(95% CI [−10.4, 3.0]),在脚手架条件下为 -4.2([−8.9, 0.4])。指定的真实性可能保持潜在状态。在代理主导运行中,发音错误仅使成功率变化 -0.5 点,但增加了24点的拼写请求和26秒的时间。因此,真实性增加了修复成本,但无法解释高的基线失败率。
图 4:呼叫者真实性在代理主导(实心圆)和脚手架(虚线方块)运行中的影响。柱状图显示任务聚类的95% Hájek 区间与合格的干净分配相比;无一在 Holm 校正后存活。
表 2:值库共性相似文章
EVA-Bench:评估语音代理的新型端到端框架
EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。
MTR-Suite:一个用于评估和合成对话检索基准的框架
介绍MTR-Suite,一个用于评估和合成对话检索基准的统一框架,具备基于LLM的审计器、用于成本效益对话生成的多智能体流水线,以及一个具有高区分度的基准。
ServiceNow 推出 EVA:评估语音智能体的新框架
ServiceNow 发布 EVA,这是一个面向对话式语音智能体的端到端评估框架,能够同时评估任务准确率和对话体验。
Enjoy Your Talk: 一个以人为中心的多轮对话基准,采用解耦的用户模拟、目标建模与评判
本文介绍了EYT-Bench,一个以人为中心的基准,用于评估多轮对话中的LLM,采用了解耦的用户模拟、目标建模和评判设计。它揭示了闭源和开源模型在客观意图追踪上差异显著,但在主观维度上相似;推理能力提升了客观追踪,而人物角色格式强烈影响轨迹分布。
我的语音助手本来很智能,直到一个电话号码被转录错误。
本文认为,语音助手的语音转文字(STT)应该根据实体准确性(例如电话号码、日期)来评估,而不是一般的词错误率,因为遗漏关键字段可能会破坏工作流程。文章提到使用HubSpot字段进行测试,并指出Smallest AI Pulse是一个有趣的工具,可以实时捕获工作流关键实体。