量化ASR模型中的基准优化
摘要
本文通过行为探测方法,量化了高性能ASR模型如何通过非真实反映转录能力的方式优化基准测试以提升分数,揭示了基准条件下的模型行为。
查看缓存全文
缓存时间: 2026/08/21 08:08
论文页面 - 走向量化ASR模型中的基准优化
来源:https://huggingface.co/papers/2608.19936
摘要
高性能语音识别模型即使在音频内容矛盾的情况下,仍能复现基准测试的转录文本,这揭示了基准优化行为——该行为会提升评分,却并未改进真实场景下的转录能力。
公开基准测试是衡量自动语音识别(https://huggingface.co/papers?q=Automatic%20Speech%20Recognition)(ASR) 模型能力的重要标准。然而,由于其公开性,模型可能在这些基准测试上被优化,且这种优化往往无法很好地泛化到真实数据。我们提出了一种量化基准优化(https://huggingface.co/papers?q=benchmark%20optimization)的方法论,重点关注音频信息不足以确定参考转录文本的案例。我们识别了三类行为探针,用以揭示模型在音频信息不足的情况下仍能复现基准参考文本片段的能力:参考文本分歧(https://huggingface.co/papers?q=reference%20disagreement)、掩蔽数字恢复(https://huggingface.co/papers?q=masked-number%20recovery)以及拼写切换(https://huggingface.co/papers?q=orthographic%20switching)。我们发现,得分最高的开源模型在相关音频内容矛盾、被掩蔽或存在歧义时,仍会逐字输出参考转录文本片段。通过使用多种机制探针(https://huggingface.co/papers?q=mechanistic%20probes),我们展示了模型会响应特定的声学线索,从而为了采用基准优化策略而牺牲对音频的真实反映。我们进一步表明,可以通过低秩线性引导(https://huggingface.co/papers?q=low-rank%20linear%20steering)或在某些情况下简单地在片段末尾附加音频,来因果性地操控基准优化行为。总体而言,我们的结果表明,高性能模型表现出受基准测试条件影响的行为,这种行为会虚增基准性能,但并未体现其通用转录能力的提升。
查看 arXiv 页面 (https://arxiv.org/abs/2608.19936)查看 PDF (https://arxiv.org/pdf/2608.19936)GitHub1 (https://github.com/HumeAI/asr-benchmark-optimization)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.19936)
在您的智能体中获取此论文:
hf papers read 2608\.19936
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.19936 以将其链接到此页面。
引用此论文的数据集0
无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.19936 以将其链接到此页面。
引用此论文的 Spaces0
无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.19936 以将其链接到此页面。
包含此论文的收藏夹0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以将其链接到此页面。
相似文章
测量语音识别中的基准优化
本文探讨了关于测量语音识别中基准优化的研究,指出某些语音识别模型可能针对测试基准进行优化而非真实场景性能,并介绍了用于量化该现象的测试方法。
什么算错误?面向非典型ASR的双参考基准测试方法
本文提出了一种面向非典型ASR的双参考基准测试方法,同时使用逐字转录和意图转录对11个ASR模型在口吃语音上进行评估,强调了根据用例选择合适参考转录的重要性。
我们基准测试的是无人实际运行的模型
文章批评了AI模型在不同量化格式下缺乏系统性基准测试,突出了基准测试结果与实际使用之间的差异,并呼吁进行更彻底的评估。
当AI基准陷入平台期:基准饱和的系统性研究
一项系统性研究,定义并分析了60个语言模型基准中的基准饱和现象,发现近一半的基准已出现饱和,且专家精选的基准更具韧性,为构建持久评估提供了设计选择。
AI模型构建者的不稳定指标与基准测试文化
本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。