严重声学偏移下的原型修正迭代自监督流形去噪

Hugging Face Daily Papers 论文

摘要

PRISM是一种无需训练的测试时适应方法,利用冻结的文本原型逆转音频文本模型中的低秩仿射噪声失真,在严重声学噪声下显示显著改进。

音频文本基础模型(ATMs)在严重声学噪声下灾难性失效,然而现有适应策略要么依赖基于梯度的测试时适应(TTA),这会强化噪声而非信号,要么依赖需要推理时无法获取的特权噪声注释的提示调优。我们通过PRISM(原型修正迭代自监督流形去噪)解决了这些失败问题,这是一个无需训练、无源的TTA框架,基于仿射噪声假设:严重声学噪声在多模态潜在空间中诱导低秩仿射偏移,超过90%的失真能量集中在前60个主成分中。PRISM使用冻结的文本原型作为几何锚点,通过三个封闭形式的几何校正估计并逆转这种失真,这些校正通过仿射偏置回归编译成单一静态投影矩阵。在推理时,适应减少到0.0009毫秒内的一次矩阵向量乘法,使其比基于梯度的TTA快得多,同时无需额外训练。在UrbanSound8K上,PRISM比零样本基线提高了12.94个百分点,尽管从未观察到其特权增强噪声提示,仍超越了oracle辅助的TTA基线9.41个百分点。我们进一步识别了多声部陷阱,这是宽带类子空间收缩的一个合理失败模式,并通过置信感知回归(CAR)解决它,为最受影响的类恢复了高达8.16个百分点。
查看原文
查看缓存全文

缓存时间: 2026/08/18 07:50

论文页面 - 针对严重声学偏移的原型校正迭代自监督流形降噪

来源: https://huggingface.co/papers/2608.15037

摘要

PRISM 是一种快速、无需训练的测试时自适应方法,利用冻结的文本原型和几何校正,逆转音频-文本模型中的低秩仿射噪声失真。

音频-文本基础模型 (https://huggingface.co/papers?q=Audio-Text%20Foundation%20Models) (ATMs) 在严重声学噪声下会出现灾难性失效,而现有的自适应策略要么依赖基于梯度的测试时自适应 (https://huggingface.co/papers?q=Test-Time%20Adaptation) (TTA)(这反而会强化噪声而非信号),要么依赖需要在推理阶段无法获得的特权噪声标注的提示调优。我们用 PRISM(原型校正迭代自监督流形降噪 (https://huggingface.co/papers?q=Prototype-Rectified%20Iterative%20Self-supervised%20Manifold%20Denoising))解决了这些问题,这是一个无需训练、无需源数据的 TTA 框架,其理论基础是仿射噪声假设 (https://huggingface.co/papers?q=Affine%20Noise%20Hypothesis):严重声学噪声在多模态潜在空间中引起低秩仿射偏移,超过 90% 的失真能量集中在前 60 个主成分中。PRISM 利用冻结的文本原型作为几何锚点,通过三个闭式几何校正(这些校正通过仿射偏差回归 (https://huggingface.co/papers?q=Affine%20Bias%20Regression) 被编译成一个静态投影矩阵),从未标记的目标批次中估计并逆转这种失真。在推理阶段,自适应简化为一次 0.0009 毫秒的矩阵-向量乘法,这使其比基于梯度的 TTA 快得多,且无需额外训练。在 UrbanSound8K 数据集上,PRISM 比零样本基线提升了 12.94 个百分点,并超过了一个有特权增强噪声提示辅助的 TTA 基线 9.41 个百分点,尽管它从未观察过那些特权提示。我们还识别了多声部陷阱 (https://huggingface.co/papers?q=Polyphonic%20Trap)(一种针对宽带类别子空间通胀的系统性失效模式),并通过置信度感知回归 (https://huggingface.co/papers?q=Confidence-Aware%20Regression) (CAR) 解决了它,为受影响最严重的类别恢复了高达 8.16 个百分点的性能。

查看 arXiv 页面 (https://arxiv.org/abs/2608.15037)查看 PDF (https://arxiv.org/pdf/2608.15037)GitHub 仓库1 (https://github.com/Ashish-1108/PRISM)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15037)

在你的智能体中获取此论文:

hf papers read 2608\.15037

还没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.15037 以从本页链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.15037 以从本页链接它。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.15037 以从本页链接它。

包含此论文的收藏夹 0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页链接它。

相似文章

PRISM:通过结构化多模态数据合成实现优先级感知的规则内化

arXiv cs.LG

本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。