标签
RankShift是一种新型的数据库内方法,用于检测和解释数据流中的分类偏移,使用Pearson分数来识别责任类别,并在日志数据集上显示出与自动编码器相竞争的性能。
本文提出 D^CF5 诊断工具,用于预测分布偏移下回归任务动态集成中逐区域的增益变化,经多数据集验证其预测结果具有高度相关性。
本文介绍了DRACP,一种共形预测方法,它统一多种适应机制,在分布偏移下提供可靠的经济预测区间,实现以更宽区间的校准。
本研究论文探讨数据扰动如何影响高效AI推理中模型级联的准确性和鲁棒性,识别关键失败模式,并强调在分布偏移下进行评估的必要性。
本文介绍了Regime-Conditional Verification (RCV),这是一个轻量级包装器,通过估计预测正确性并检测分布偏移,无需重新训练即可调整用于大型语言模型的现成安全分类器。
该论文引入了自诊断模型,用于在分布漂移下归因模型失败原因,将不确定性估计与失败归因联系起来。
本文识别了像素级别的隐形元数据痕迹,这些痕迹被视觉编码器用作捷径,导致在元数据分布偏移下出现性能下降。在预训练期间和之后采取的缓解策略,能降低对目标元数据和未见元数据的敏感性,同时不牺牲下游性能。
本文提出了前沿学习(Frontier Learning)框架,该框架结合多个黑盒和白盒预训练模型的表示与预测,构建统一的目标域表示,并保证在分布偏移下性能不劣于任何单一复用基线。在视觉域适应和临床死亡率预测上的评估显示,该方法相较强基线持续获得增益。
Introduces CALCoDe, a post-hoc reliability layer for frozen medical vision-language models that mitigates class-tail undercoverage under clinical shift, achieving strong worst-class accepted coverage across multiple dermatology shifts and VLM backbones.
OPERA提出了一种多智能体集成框架,将专家权重分配视为用于通用生物医学图像分析的离线策略学习问题,实现了无需重新训练的测试时自适应,并在9个数据集和30多个基线上持续提升性能。
提出 Token-Level Off-Policy Labeling (TOPL),一种用于忠实生成的离策略训练范式,将后训练重新定义为词元级正确性预测,在摘要和机器翻译任务上实现了强大的分布外泛化能力。
GRACE 使用类型化语义图来表示 LLM 智能体的持久指令,通过对更新进行范围验证,提高了分布偏移下的可靠性。在电信智能体框架上的实验表明,相较于基线方法,严格可靠性有显著提升。
介绍PARA-PV,一种面向光伏功率预测的物理感知检索增强框架,利用冻结的Chronos时间序列基础模型和分布偏移校正来提高准确性,并处理峰值、斜坡和低功率条件。
本文介绍了NEST,一个使用面向机制的混合专家模型来处理时间序列预测中数据集级分布偏移的框架,在多个基准测试上达到了最先进的性能。
本文介绍了一项实证研究,比较不同神经架构(MLPs、CNNs、RNNs、预训练transformer)在图像和文本领域的时间分布偏移下的性能退化,发现利用局部特征的模型退化最快,而预训练编码器的漂移较为缓慢。
本文研究了基于深度学习的气候降尺度中的时态分布外偏移问题,并提出了一种域自适应框架,该框架结合了监督重建与域对齐,以在非平稳条件下改进高分辨率气候预测。
本文提出了一种方法,通过强化学习训练时构建可控泛化失败的语言模型,展示了训练成功与泛化在结构化方式下可能发生偏离。
损失平滑在自适应过程中在源目标和目标目标之间进行插值,在保留有用特征的同时实现专门化。在监督偏移、强化学习和语言模型微调中的实验显示一致的改进。
ComMem 提出了受生物记忆启发的互补记忆系统,以改进视觉语言模型的测试时自适应,在15个基准测试上超越了现有最先进方法。
本文刻画了保形风险控制何时能为结构化LLM输出提供认证,证明了不可能性界限,并分析了不同界限下的认证层次。在六个开放权重模型上的实证验证表明,困难配置在低风险水平下无法被认证,但在放宽目标下可实现实际认证。