shortcut-learning

标签

Cards List
#shortcut-learning

When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

arXiv cs.AI · 2026-08-05 缓存

This paper identifies a refusal-cue shortcut in safety guard models, where inserting refusal expressions into harmful responses can flip their harmless classification. The authors audit datasets like WildGuardMix and GR-Train, show the issue persists in official models such as LlamaGuard3 and Qwen3Guard, and propose a post-hoc intervention to suppress shortcut-associated components.

0 人收藏 0 人点赞
#shortcut-learning

隐形捷径:视觉编码器为何洞悉你的相机

Hugging Face Daily Papers · 2026-08-05 缓存

本文识别了像素级别的隐形元数据痕迹,这些痕迹被视觉编码器用作捷径,导致在元数据分布偏移下出现性能下降。在预训练期间和之后采取的缓解策略,能降低对目标元数据和未见元数据的敏感性,同时不牺牲下游性能。

0 人收藏 0 人点赞
#shortcut-learning

控制L2英语口语自动评分系统中隐式捷径依赖

arXiv cs.CL · 2026-07-20 缓存

本文提出了一种新颖的训练准则,旨在减少自动英语口语能力评估系统对捷径的依赖,防止考生在没有真正进步的情况下通过利用捷径提高分数。在基于音频和文本的系统的实验表明,该方法降低了与可被利用特征的相关性,使自动评分更接近人工评判。

0 人收藏 0 人点赞
#shortcut-learning

法律判决预测中的捷径学习:来自英国就业法庭的经验证据

arXiv cs.AI · 2026-07-07 缓存

本文利用英国就业法庭的索赔案例,实证研究了法律判决预测中的捷径学习现象,发现模型会利用事后司法文本中揭示结果线索,但在掩盖这些泄露特征后,模型性能依然保持稳健。

0 人收藏 0 人点赞
#shortcut-learning

为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径

Hugging Face Daily Papers · 2026-07-02 缓存

本文研究了阻碍零样本组合动作识别中组合泛化能力的物体驱动捷径,提出了RCORE来缓解动词塌缩并提升未见组合的泛化能力。

0 人收藏 0 人点赞
#shortcut-learning

多传感器融合泛化失败:动物级别和时间分布偏移下的牛姿态分类

arXiv cs.LG · 2026-06-25 缓存

本文评估了多传感器融合在时间分布偏移下对牛姿态分类的稳健性,发现多模态模型性能显著下降,而更简单的单传感器模型泛化能力更好,揭示了捷径学习问题。

0 人收藏 0 人点赞
#shortcut-learning

风格还是内容?在受控内容重叠下评估风格分类器

arXiv cs.CL · 2026-06-08 缓存

本文利用平行圣经翻译引入了一种受控内容重叠设置,用于评估风格分类器在多大程度上依赖内容线索而非实际风格特征。结果表明,当移除内容线索时,低重叠模型性能下降,而高重叠模型则迁移得更为稳健。

0 人收藏 0 人点赞
#shortcut-learning

EEG基础模型中的身份陷阱:诊断性审计

arXiv cs.LG · 2026-06-08 缓存

本文识别并诊断了EEG基础模型中的“身份陷阱”,即高准确率可能源于受试者身份特征而非真实的临床生物标志物。它提出了FMScope,一种冻结表示协议以分离这些信号,并证明了受试者身份混杂在三模型中普遍存在且可通过线性方法移除。

0 人收藏 0 人点赞
#shortcut-learning

SpurAudio:用于研究少样本音频分类中捷径学习的基准测试

arXiv cs.AI · 2026-06-04 缓存

SpurAudio 是一个新的基准测试,旨在评估少样本音频分类中的捷径学习与虚假相关性问题。研究表明,当背景相关性被打破时,包括大型预训练音频基础模型在内的最先进方法均出现显著的性能下降。

0 人收藏 0 人点赞
#shortcut-learning

读出捷径:位置数字复制主导小型语言模型中的算术CoT读出

arXiv cs.LG · 2026-05-25 缓存

本文发现了一种‘位置复制’捷径:小型语言模型通过复制答案分隔符前的最后一个数字来回答算术问题,绕过了实际推理。该效应解释了为何打乱CoT步骤仍能保持性能;在GSM8K上,它占1-3B模型教师强制准确率的89-92%。

0 人收藏 0 人点赞
#shortcut-learning

Transformer模型学习中产生的捷径策略损害其持续组合推理能力

arXiv cs.LG · 2026-05-08 缓存

本研究论文探讨了Transformer模型(特别是BERT)在学习过程中产生的捷径策略如何削弱其持续组合推理能力。研究将BERT与ALBERT进行对比,发现ALBERT的循环特性为持续学习任务提供了更好的归纳偏置。

0 人收藏 0 人点赞
#shortcut-learning

思维链削弱多模态大模型的视觉空间推理能力

Hugging Face Daily Papers · 2026-04-17 缓存

研究表明,由于捷径学习和仅凭文本臆造视觉细节,思维链提示会损害多模态大模型在视觉空间推理方面的表现。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈