严重声学偏移下的原型修正迭代自监督流形去噪
摘要
PRISM是一种无需训练的测试时适应方法,利用冻结的文本原型逆转音频文本模型中的低秩仿射噪声失真,在严重声学噪声下显示显著改进。
查看缓存全文
缓存时间: 2026/08/18 07:50
论文页面 - 针对严重声学偏移的原型校正迭代自监督流形降噪
来源: https://huggingface.co/papers/2608.15037
摘要
PRISM 是一种快速、无需训练的测试时自适应方法,利用冻结的文本原型和几何校正,逆转音频-文本模型中的低秩仿射噪声失真。
音频-文本基础模型 (https://huggingface.co/papers?q=Audio-Text%20Foundation%20Models) (ATMs) 在严重声学噪声下会出现灾难性失效,而现有的自适应策略要么依赖基于梯度的测试时自适应 (https://huggingface.co/papers?q=Test-Time%20Adaptation) (TTA)(这反而会强化噪声而非信号),要么依赖需要在推理阶段无法获得的特权噪声标注的提示调优。我们用 PRISM(原型校正迭代自监督流形降噪 (https://huggingface.co/papers?q=Prototype-Rectified%20Iterative%20Self-supervised%20Manifold%20Denoising))解决了这些问题,这是一个无需训练、无需源数据的 TTA 框架,其理论基础是仿射噪声假设 (https://huggingface.co/papers?q=Affine%20Noise%20Hypothesis):严重声学噪声在多模态潜在空间中引起低秩仿射偏移,超过 90% 的失真能量集中在前 60 个主成分中。PRISM 利用冻结的文本原型作为几何锚点,通过三个闭式几何校正(这些校正通过仿射偏差回归 (https://huggingface.co/papers?q=Affine%20Bias%20Regression) 被编译成一个静态投影矩阵),从未标记的目标批次中估计并逆转这种失真。在推理阶段,自适应简化为一次 0.0009 毫秒的矩阵-向量乘法,这使其比基于梯度的 TTA 快得多,且无需额外训练。在 UrbanSound8K 数据集上,PRISM 比零样本基线提升了 12.94 个百分点,并超过了一个有特权增强噪声提示辅助的 TTA 基线 9.41 个百分点,尽管它从未观察过那些特权提示。我们还识别了多声部陷阱 (https://huggingface.co/papers?q=Polyphonic%20Trap)(一种针对宽带类别子空间通胀的系统性失效模式),并通过置信度感知回归 (https://huggingface.co/papers?q=Confidence-Aware%20Regression) (CAR) 解决了它,为受影响最严重的类别恢复了高达 8.16 个百分点的性能。
查看 arXiv 页面 (https://arxiv.org/abs/2608.15037)查看 PDF (https://arxiv.org/pdf/2608.15037)GitHub 仓库1 (https://github.com/Ashish-1108/PRISM)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15037)
在你的智能体中获取此论文:
hf papers read 2608\.15037
还没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.15037 以从本页链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.15037 以从本页链接它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.15037 以从本页链接它。
包含此论文的收藏夹 0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页链接它。
相似文章
PRISM: 先验纠正与不确定性感知结构建模的基于扩散的文本图像超分辨率
PRISM是一个基于扩散的文本图像超分辨率框架,利用流匹配先验纠正和不确定性感知残差编码来提升严重退化下的准确性,实现了毫秒级推理的最新性能。
PRISM:面向多层薄膜设计的位置编码回归逆光谱模型
PRISM是一种仅解码器的自回归变换器,通过联合预测材料选择和厚度来解决多层薄膜光学涂层设计的逆问题,以更小的模型实现了最先进的性能。
基于扰动的减法映射区域可解释性(PRISM):语言模型与卒中后失语症中的命名错误分离
本文介绍了PRISM,一种用于大型语言模型空间分辨可解释性的基于扰动的方法,将神经影像减法分析适配到Transformer,并平行应用于卒中后失语症患者,以恢复共享的语音优势分离。
PRISM:通过结构化多模态数据合成实现优先级感知的规则内化
本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。
PRISM:一种将漂移分解为尺度、形状和头部的几何风险界
本文介绍了 PRISM,这是一种几何风险界,将训练后大型语言模型(LLM)变体中的模型漂移分解为尺度、形状和头部三个维度,以诊断量化误差或灾难性遗忘等特定故障模式。