标签
该论文引入了自诊断模型,用于在分布漂移下归因模型失败原因,将不确定性估计与失败归因联系起来。
本文识别了像素级别的隐形元数据痕迹,这些痕迹被视觉编码器用作捷径,导致在元数据分布偏移下出现性能下降。在预训练期间和之后采取的缓解策略,能降低对目标元数据和未见元数据的敏感性,同时不牺牲下游性能。
本文提出了前沿学习(Frontier Learning)框架,该框架结合多个黑盒和白盒预训练模型的表示与预测,构建统一的目标域表示,并保证在分布偏移下性能不劣于任何单一复用基线。在视觉域适应和临床死亡率预测上的评估显示,该方法相较强基线持续获得增益。
Introduces CALCoDe, a post-hoc reliability layer for frozen medical vision-language models that mitigates class-tail undercoverage under clinical shift, achieving strong worst-class accepted coverage across multiple dermatology shifts and VLM backbones.
OPERA提出了一种多智能体集成框架,将专家权重分配视为用于通用生物医学图像分析的离线策略学习问题,实现了无需重新训练的测试时自适应,并在9个数据集和30多个基线上持续提升性能。
提出 Token-Level Off-Policy Labeling (TOPL),一种用于忠实生成的离策略训练范式,将后训练重新定义为词元级正确性预测,在摘要和机器翻译任务上实现了强大的分布外泛化能力。
GRACE 使用类型化语义图来表示 LLM 智能体的持久指令,通过对更新进行范围验证,提高了分布偏移下的可靠性。在电信智能体框架上的实验表明,相较于基线方法,严格可靠性有显著提升。
介绍PARA-PV,一种面向光伏功率预测的物理感知检索增强框架,利用冻结的Chronos时间序列基础模型和分布偏移校正来提高准确性,并处理峰值、斜坡和低功率条件。
本文介绍了NEST,一个使用面向机制的混合专家模型来处理时间序列预测中数据集级分布偏移的框架,在多个基准测试上达到了最先进的性能。
本文介绍了一项实证研究,比较不同神经架构(MLPs、CNNs、RNNs、预训练transformer)在图像和文本领域的时间分布偏移下的性能退化,发现利用局部特征的模型退化最快,而预训练编码器的漂移较为缓慢。
本文研究了基于深度学习的气候降尺度中的时态分布外偏移问题,并提出了一种域自适应框架,该框架结合了监督重建与域对齐,以在非平稳条件下改进高分辨率气候预测。
本文提出了一种方法,通过强化学习训练时构建可控泛化失败的语言模型,展示了训练成功与泛化在结构化方式下可能发生偏离。
损失平滑在自适应过程中在源目标和目标目标之间进行插值,在保留有用特征的同时实现专门化。在监督偏移、强化学习和语言模型微调中的实验显示一致的改进。
ComMem 提出了受生物记忆启发的互补记忆系统,以改进视觉语言模型的测试时自适应,在15个基准测试上超越了现有最先进方法。
本文刻画了保形风险控制何时能为结构化LLM输出提供认证,证明了不可能性界限,并分析了不同界限下的认证层次。在六个开放权重模型上的实证验证表明,困难配置在低风险水平下无法被认证,但在放宽目标下可实现实际认证。
一条推文批评了一个爆火帖子,该帖子将一节免费的斯坦福神经网络讲座重新包装成秘密交易框架,并指出真正的专业知识在于处理分布漂移,而非数学本身。
本文评估了表格基础模型在微生物组数据中受生物学启发的分布偏移下的鲁棒性,发现保护判别特征不足以保证稳定性,且零填充是最有害的扰动。
本文提出了一种基于半监督学习的测试时自适应方法,用于AI文本检测,能够适应来自新LLM、对抗性人工化和时间漂移的持续分布变化,性能优于最先进的监督式检测器。
本文评估了多传感器融合在时间分布偏移下对牛姿态分类的稳健性,发现多模态模型性能显著下降,而更简单的单传感器模型泛化能力更好,揭示了捷径学习问题。
本文介绍了U-TTT,一种带有测试时训练层和双域适配的U型深度学习模型,用于在分布偏移下实现鲁棒的PET图像去噪,在不同剂量水平和扫描仪类型上均达到了最先进性能。