量化ASR模型中的基准优化

Hugging Face Daily Papers 论文

摘要

本文通过行为探测方法,量化了高性能ASR模型如何通过非真实反映转录能力的方式优化基准测试以提升分数,揭示了基准条件下的模型行为。

公共基准是衡量自动语音识别(ASR)模型能力的重要指标。然而,因其公开特性,模型可能以无法很好泛化到真实数据的方式针对这些基准进行优化。我们提出一种量化基准优化的方法,重点关注音频信息不足以确定参考转录文本的情况。我们识别出三类行为探测方法,揭示了模型在音频信息不足时仍能复现基准参考文本片段的能力:参考文本分歧、遮隽数字恢复与拼写形式转换。研究发现,即使在相关音频存在矛盾、遮蔽或模糊性时,得分最高的开源模型仍会输出与参考转录完全一致的文本片段。通过多种机制探测,我们表明模型会依据狭窄的声学线索,覆盖对音频的真实表征,转而采用基准优化策略。我们进一步展示,在某些情况下,这种基准优化行为可通过低秩线性引导或简单地在片段末尾追加音频来进行因果操纵。总体而言,研究结果表明,高性能模型表现出基准条件下的行为,这些行为可能在未反映通用转录能力提升的情况下虚增基准性能。
查看原文
查看缓存全文

缓存时间: 2026/08/21 08:08

论文页面 - 走向量化ASR模型中的基准优化

来源:https://huggingface.co/papers/2608.19936

摘要

高性能语音识别模型即使在音频内容矛盾的情况下,仍能复现基准测试的转录文本,这揭示了基准优化行为——该行为会提升评分,却并未改进真实场景下的转录能力。

公开基准测试是衡量自动语音识别(https://huggingface.co/papers?q=Automatic%20Speech%20Recognition)(ASR) 模型能力的重要标准。然而,由于其公开性,模型可能在这些基准测试上被优化,且这种优化往往无法很好地泛化到真实数据。我们提出了一种量化基准优化(https://huggingface.co/papers?q=benchmark%20optimization)的方法论,重点关注音频信息不足以确定参考转录文本的案例。我们识别了三类行为探针,用以揭示模型在音频信息不足的情况下仍能复现基准参考文本片段的能力:参考文本分歧(https://huggingface.co/papers?q=reference%20disagreement)、掩蔽数字恢复(https://huggingface.co/papers?q=masked-number%20recovery)以及拼写切换(https://huggingface.co/papers?q=orthographic%20switching)。我们发现,得分最高的开源模型在相关音频内容矛盾、被掩蔽或存在歧义时,仍会逐字输出参考转录文本片段。通过使用多种机制探针(https://huggingface.co/papers?q=mechanistic%20probes),我们展示了模型会响应特定的声学线索,从而为了采用基准优化策略而牺牲对音频的真实反映。我们进一步表明,可以通过低秩线性引导(https://huggingface.co/papers?q=low-rank%20linear%20steering)或在某些情况下简单地在片段末尾附加音频,来因果性地操控基准优化行为。总体而言,我们的结果表明,高性能模型表现出受基准测试条件影响的行为,这种行为会虚增基准性能,但并未体现其通用转录能力的提升。

查看 arXiv 页面 (https://arxiv.org/abs/2608.19936)查看 PDF (https://arxiv.org/pdf/2608.19936)GitHub1 (https://github.com/HumeAI/asr-benchmark-optimization)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.19936)

在您的智能体中获取此论文:

hf papers read 2608\.19936

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.19936 以将其链接到此页面。

引用此论文的数据集0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.19936 以将其链接到此页面。

引用此论文的 Spaces0

无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.19936 以将其链接到此页面。

包含此论文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以将其链接到此页面。

相似文章

测量语音识别中的基准优化

Hugging Face Blog

本文探讨了关于测量语音识别中基准优化的研究,指出某些语音识别模型可能针对测试基准进行优化而非真实场景性能,并介绍了用于量化该现象的测试方法。

当AI基准陷入平台期:基准饱和的系统性研究

Hacker News Top

一项系统性研究,定义并分析了60个语言模型基准中的基准饱和现象,发现近一半的基准已出现饱和,且专家精选的基准更具韧性,为构建持久评估提供了设计选择。

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。