LALM音频裁判用于全双工语音代理的可靠性评估

arXiv cs.CL 论文

摘要

本文评估了Gemini模型作为音频裁判对全双工语音代理对话进行评分的可靠性,发现Gemini 2.5 Flash在多数维度上与人类评分者一致性较强,但模型替换需要重新验证。

arXiv:2607.07985v1 公告类型:新论文 摘要:我们报告了Gemini模型作为音频裁判的实证可靠性,该裁判直接从原始立体声波形对全双工代理对话进行评分,测试了Gemini系列中的三个模型:2.5 Flash、3.5 Flash和3.1 Pro。我们的主要证据以Gemini 2.5 Flash作为基准模型,与三位经过校准的人类评分者进行了验证,涉及209个立体声会话,在8个生产维度上进行评分:152个全双工对话跨越13个口音和条件层,以及57个对抗性缺陷注入片段。Gemini 2.5 Flash的证据在三个测试中保持一致。(i) 在8个维度中的5个上,LALM与人类之间的斯皮尔曼秩相关系数与人类两两之间的系数偏差不超过0.07,在8个维度中的7个上,两者的95%自助法置信区间重叠。(ii) 在8个维度中的6个上,LALM与三位评分者的人类平均分在60%至92%的会话中相差不超过1分。(iii) 在48个(缺陷,维度)单元中的45个上,LALM在新科姆-威尔逊95%置信区间下与人类灵敏度相当或更优,但其中大部分是统计力不足的零假设,而非证明的等价性。排序能力在Gemini系列中可迁移:3.5 Flash将简单一致性提升至8个维度全部达标,而3.1 Pro在多个维度上的评分显著低于人类,尽管秩相关性相当。模型替换应针对校准重新验证,而不能仅依据秩相关性直接假设。我们指出了四个需要谨慎部署的领域,并估计在我们当前的评估节奏下,仅依靠人类评分的成本大约是等效LALM工作量的两个数量级。本文提供的数据为在证据支持的维度上使用LALM作为替代或第四评分者提供了可辩护的实证基础。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:11

# 1 背景 来源:https://arxiv.org/html/2607.07985 面向全双工语音智能体的LALM音频裁判可靠性评估 A. Sayyad, J. Emmons, S. Jones, T. Lin, H. Krishnan Salesforce应用AI研究,eVerse团队

## 摘要

我们报告了Gemini模型作为音频裁判的实证可靠性,这些模型直接从原始立体声波形对全双工智能体对话进行评分,测试对象涵盖Gemini家族的三款模型:2.5 Flash、3.5 Flash和3.1 Pro。我们的主要证据基础以Gemini 2.5 Flash作为真实模型,在209个立体声会话上对照三位校准人工评分员进行验证,按8个生产维度进行评分:152个全双工对话涵盖13种口音与条件分层,以及57个对抗性缺陷注入片段。Gemini 2.5 Flash的证据在三个测试中保持一致。(i) 在8个维度中的5个上,LALM与人工的Spearman ρ 偏离成对人工-人工 ρ 最多0.07,并且在8个维度中的7个上,两个量的95%自助法置信区间重叠。(ii) LALM在8个维度中的6个上,在60%至92%的会话中与三人平均分相差在1分以内。(iii) 在48个(缺陷, 维度)单元格中的45个上,在Newcombe-Wilson 95%置信区间下,LALM与人工一样敏感或更优,尽管其中大多数是统计效力不足的零结果而非展示出的等价性。排序能力在Gemini家族中可迁移:3.5 Flash将简单一致性提升至8个维度,而3.1 Pro对多个维度的评分显著低于人工,尽管排序相关性相当。模型替换应专门针对校准重新验证,而不能仅凭排序相关性假设。我们确定了部署时需要注意的四个领域,并估计在当前评估节奏下,仅靠人工评分的成本大约是等效LALM工作量的两个数量级。本文提供的数据为将LALM作为替代或第四评分员部署在所支持的维度上提供了可辩护的实证基础。

**关键词:** LALM-as-judge, 音频语言模型, 验证, 语音智能体, 生产部署, 全双工音频。

我们的语音智能体产品界面依赖两个生产级音频裁判:AgentSpeechFidelity和ConversationalAudioQuality,它们共同为每个评估会话的八个维度生成评分。迄今为止,这些裁判仅在小样本上对照单个人工评分员进行过非正式验证。本研究只关注一个问题:LALM生成的评分与人工评分的接近程度是否足以替代生产音频评估流水线中的一个或多个人工评分员?我们将可替代性视为基于维度的实证属性,而非全局属性,并对照三人人工参考标准进行量化。

近期LALM-as-judge文献中的研究报道了LALM裁判与孤立文本转语音话语上的平均意见得分(MOS)之间的强相关性[1, 2, 3]。据我们所知,本研究是首次针对企业级全双工智能体对话的原始音频,对照多人工评分员参考标准来评估LALM作为裁判。我们针对立体声智能体-客户端对话进行评估,其中声道内容、轮流说话动态和会话不流畅性均影响评分分布。我们使用生产级评估堆栈将该工作扩展到全双工对话音频。

## 2 相关工作

**针对语音的LALM-as-judge。** AudioJudge [1] 以高系统级人工相关性评判语音属性(发音、语速、质量);ALLD [2] 生成描述性MOS判断;SpeechQualityLLM [3] 预测维度级MOS。诸如AIR-Bench [10] 的广泛基准测试使用文本LLM对自由形式输出进行评分,而非针对人类验证音频裁判。所有这些工作都基于孤立话语,且没有报告针对全双工对话音频的多人工评分员验证。

**全双工评估。** Full-Duplex-Bench [8] 及其多轮后续版本 [9] 对口语对话系统的轮流说话、重叠和延迟进行评分;后者是对自动考官与LLM阅读*转录稿*的交互进行评判,而非波形。两者均通过程序化或基于转录稿的指标针对会话*行为*,而非从音频中针对人类进行逐维度的音频*保真度*评分。我们填补了这一空白:我们测量了生产级、原生音频的LALM裁判在立体声全双工智能体-客户端对话中,其逐维度评分与三位校准人工评分员的跟踪紧密程度。

**可靠性 vs. 有效性。** 我们引用一个长期存在的心理测量学事实:当评分饱和在量表一端附近时,高原始一致性可能与接近零的校正后一致性共存,即Krippendorff α [6] 等统计量的天花板退化问题。这一点虽不新颖,但实质性地决定了LALM音频裁判验证应如何报告,促使我们采用逐区域处理(第4.2节),而非单一总体数字。

## 3 研究设计

我们对总共209个会话进行评分:152个全双工智能体-客户端对话,涵盖13种口音与条件分层(六种干净分层跨越美式-1、美式-2、印度、英国、法国和意大利口音,加上七种编解码退化分层,将口音与不同的会话压力角色配对),以及57个从预留的高质量基线中导出的对抗性扰动片段。会话来自生产级客户支持语音智能体。三位Salesforce签约的标注员(此前未接触过该产品)使用1-5李克特量表对每个会话的八个生产维度进行评分,量表锚点标示在1、3、5分位置,并在正式批次开始前举行了结构化校准会议。按8个维度、3位评分员计算,共产生 209 × 8 × 3 = 5,016 个评分观测值。

我们通过Vertex AI generate-content API使用Gemini 2.5 Flash对每个会话进行评分,使用与生产环境相同的提示词和JSON模式。两个生产裁判,AgentSpeechFidelity(维度1-4)和ConversationalAudioQuality(维度5-8),直接接收原始立体声WAV音频字节作为音频输入部分(智能体在左声道,人类客户端在右声道),不进行转录或中间特征提取;每个裁判在默认Vertex AI生成配置(温度1,启用思考)下返回结构化的JSON分数。我们将LALM评分与三位人工评分员进行平等比较,将LALM视为候选第四评分员。对抗性片段通过相同的评分流水线由相同裁判进行评分。图1显示了整体设计。

<figure>
<p>立体声WAV (智能体L / 客户端R) → 2个LALM裁判 (Gemini 2.5 Flash) 原始音频输入,默认Vertex AI配置 → 3位校准人工评分员 1-5李克特,有锚点量规 → 每个会话×每个维度的分数 (209个会话 × 8个维度) → 一致性分析</p>
<figcaption>图1: 研究设计。每个立体声会话由两个生产级LALM裁判(Gemini 2.5 Flash,原始音频输入)和三位校准人工评分员独立评分,基于相同的八个维度。</figcaption>
</figure>

在整个研究中,我们报告四个一致性统计量,每个都在使用点定义,并在附录D.2及周围小节中完整说明:成对Spearman ρ(含1000次迭代自助法95%置信区间,种子42)用于排序一致性;在三人平均分1分以内的会话比例用于简单一致性;序数Krippendorff α用于校正后评分者间信度;以及用于对抗性臂的LALM减人工召回率差异的Newcombe-Wilson混合置信区间。图2总结了语料库如何划分到分析池中。

<figure>
<p>生产级客户支持语音智能体 → 209个评分的立体声会话 × 8个维度 × 3位评分员 (5,016个评分观测值) → 152个对话会话 (13种口音与条件分层:6种干净 + 7种编解码退化) → 57个对抗性片段 (10个基线 × 6种DSP缺陷;名义上60个,3个渲染失败) → 召回分析:8个基线具有完整的3人覆盖;每个(缺陷, 维度)单元格 n ≤ 8,4个单元格 n = 7</p>
<figcaption>图2: 209个会话分析池的样本流程。所有209个会话均贡献于逐维度一致性统计量(表1);对抗性臂额外支持缺陷检测分析,该分析仅限于具有完整三人覆盖的8个基线。</figcaption>
</figure>

## 4 证据

### 4.1 LALM与人类的一致性程度与人类彼此间的一致性大致相当

我们计算LALM与每位单独人工评分员之间的成对Spearman ρ,取三个(LALM, 人工)值的平均值,并与人工之间三个成对评分员-评分员Spearman ρ值的平均值进行比较(图3)。在8个维度中的5个上(accent_dialect_handling, entity_pronunciation, speech_clarity, prosody_naturalness, 以及 speaking_rate_adaptation),LALM与人类的一致性相当于人类彼此间的一致性:LALM-人工 ρ 与人工-人工 ρ 相差最多0.07。这是语料库中匹配最紧密的五个维度(差距0.03至0.07),与第六个维度(0.12)有明显边界。在两个维度上(entity_pronunciation, speech_clarity),LALM与人类的相关性比人类彼此间的相关性更强(分别为0.13 vs 0.09 和 0.08 vs 0.01)。此测试仅涉及*排序一致性*;一个维度在此处可能显示接近人类的排序一致性,但与人工平均值的绝对一致性仍可能较低(第4.2节)。speaking_rate_adaptation正是这样一个案例,我们将在那里讨论。

这种等价性通过分布测试得到加强。在1000次迭代自助法重采样(种子42)下,LALM-人工ρ的95%置信区间在8个维度中的7个上与人工-人工ρ的置信区间重叠:在这七个维度上,LALM与人类的一致性在统计上无法与人类彼此间的一致性区分。例外是audio_clarity,该维度上区间不重叠(人工-人工 [+0.34, +0.58] vs LALM-人工 [+0.00, +0.30]),与点估计中已经可见的差距一致。我们将此测试视为支持性而非首要结果,因为重叠部分是由适度的评分者间一致性产生的宽置信区间所驱动;因此我们将比较锚定在上述逐维度差距上。人工-人工区间未在本文其他地方列出;它是使用与附录D.4相同的自助法过程计算得出,重采样会话而非评分员对。

<figure>
<p>图3: 逐维度Spearman ρ。蓝色:成对人工-人工 ρ,对三个评分员对取平均。橙色:LALM-人工 ρ,对三个(LALM, 人工)对取平均。当两个柱状图接近时,LALM在该维度上跟踪人工评分的程度等同于第四位人工评分员。</p>
</figure>

在另外两个维度上(audio_clarity, interruption_audio_quality),LALM与人类正相关,但弱于人类彼此间的相关性。具体而言,在audio_clarity上,人工-人工ρ为0.47,LALM-人工ρ为0.25;LALM相关性为正,但大约是人工-人工值的一半。在第八个维度(overall_fidelity)上,LALM-人工ρ基本为零(−0.01),而人类彼此间的相关性也仅为0.11;两者均未表现出强烈的排序区分信号。对部署的直接含义是:如果部署标准是“LALM是否像第四位人工评分员一样行事?”,那么数据在5个维度上支持“是”,在2个维度上部分支持“是”,在1个维度上尚无定论。

### 4.2 生产维度上的简单一致性较高

在人类评分饱和在量表顶端时,排序相关性可能不具信息性,因为底层分数分布方差非常低。互补统计量是简单一致性:LALM评分在三人平均分1分以内的会话比例。表1报告了该数值以及排序相关性和人类平均分。

<figure>
<p>表1: 基于全体 n=209 的三人评分池(与第4.3节的对抗性召回分析不同,后者仅限于8个基线)的LALM-人工均值一致性统计量。“1分以内百分比”是LALM评分在跨评分员人工平均分1分以内的会话比例;“Avg人工ρ”是成对人工-人工Spearman ρ的平均值;“Krip. α”是使用序数加权的校正后评分者间Krippendorff α [6]。</p>
</figure>

八个维度中的六个显示LALM与人工均值的一致性达到60%或更高,三个达到89%或以上。两个维度,speaking_rate_adaptation和overall_fidelity,低于50%。我们将这些视为LALM评分不足以作为独立指标的维度(第5节)。注意,speaking_rate_adaptation出现在第4.1节的五个排序一致性维度中:其LALM-人工*排序*相关性跟踪了人工-人工水平,但其LALM-均值 1分以内绝对一致性较低,因此它在排序上可靠,但不能作为独立指标部署。两个标准衡量不同事物,speaking_rate_adaptation是两者存在分歧的唯一维度。

校正后Krippendorff α列揭示了为什么简单一致性是这些维度的正确视角。序数α在每个维度上都接近零或为负,范围仅为 −0.15 到 +0.08,即使1分以内一致性超过90%也是如此,例如speech_clarity上α=−0.15,尽管1分以内一致性为90.9%。这是最显著形式的可靠性悖论:人工小组在绝对意义上对绝大多数会话达成一致,但校正后统计量却显示基本没有一致性,因为在饱和维度上评分方差太小,α无法分辨。因此,我们同时报告α和简单一致性,而非替代,并提醒注意,天花板维度上的接近零α反映了评分分布的形状,而非真正的评分员分歧。

### 4.3 对抗性缺陷检测:非对称敏感性,少数显著单元格

为了测试对受控音频退化的敏感性,我们对10个高质量基线会话应用六种DSP级缺陷(硬振幅削波、静音、−2至−8 dB SNR的加性高斯噪声、话语中段截断、音素区域叠加、8 kHz采样率降/升采样),名义上60个片段语料库中成功渲染了57个。我们将召回分析限制在具有完整三人覆盖的8个基线上,每个(缺陷, 维度)单元格最多 n=8(四个单元格降为 n=7)。对于每个单元格,我们测量召回率:评分员评分相对该片段基线下降至少1分的扰动片段比例。对于LALM,其评分是其单一评分;对于人工,我们使用三人平均分的下降。

相似文章

Gemini 音频模型升级,打造更强大的语音体验

Google DeepMind Blog

Google 更新了 Gemini 2.5 Flash Native Audio,以提升实时语音智能体的能力,包括更精准的函数调用、更好的指令遵循能力,以及更流畅的对话上下文检索。此次更新还在 Google Translate 应用 beta 版中引入了实时语音翻译功能,可在 70 多种语言中保留语音语调。