标签
提出 Token-Level Off-Policy Labeling (TOPL),一种用于忠实生成的离策略训练范式,将后训练重新定义为词元级正确性预测,在摘要和机器翻译任务上实现了强大的分布外泛化能力。
GRACE 使用类型化语义图来表示 LLM 智能体的持久指令,通过对更新进行范围验证,提高了分布偏移下的可靠性。在电信智能体框架上的实验表明,相较于基线方法,严格可靠性有显著提升。
介绍PARA-PV,一种面向光伏功率预测的物理感知检索增强框架,利用冻结的Chronos时间序列基础模型和分布偏移校正来提高准确性,并处理峰值、斜坡和低功率条件。
本文介绍了NEST,一个使用面向机制的混合专家模型来处理时间序列预测中数据集级分布偏移的框架,在多个基准测试上达到了最先进的性能。
本文介绍了一项实证研究,比较不同神经架构(MLPs、CNNs、RNNs、预训练transformer)在图像和文本领域的时间分布偏移下的性能退化,发现利用局部特征的模型退化最快,而预训练编码器的漂移较为缓慢。
本文研究了基于深度学习的气候降尺度中的时态分布外偏移问题,并提出了一种域自适应框架,该框架结合了监督重建与域对齐,以在非平稳条件下改进高分辨率气候预测。
本文提出了一种方法,通过强化学习训练时构建可控泛化失败的语言模型,展示了训练成功与泛化在结构化方式下可能发生偏离。
损失平滑在自适应过程中在源目标和目标目标之间进行插值,在保留有用特征的同时实现专门化。在监督偏移、强化学习和语言模型微调中的实验显示一致的改进。
ComMem 提出了受生物记忆启发的互补记忆系统,以改进视觉语言模型的测试时自适应,在15个基准测试上超越了现有最先进方法。
本文刻画了保形风险控制何时能为结构化LLM输出提供认证,证明了不可能性界限,并分析了不同界限下的认证层次。在六个开放权重模型上的实证验证表明,困难配置在低风险水平下无法被认证,但在放宽目标下可实现实际认证。
一条推文批评了一个爆火帖子,该帖子将一节免费的斯坦福神经网络讲座重新包装成秘密交易框架,并指出真正的专业知识在于处理分布漂移,而非数学本身。
本文评估了表格基础模型在微生物组数据中受生物学启发的分布偏移下的鲁棒性,发现保护判别特征不足以保证稳定性,且零填充是最有害的扰动。
本文提出了一种基于半监督学习的测试时自适应方法,用于AI文本检测,能够适应来自新LLM、对抗性人工化和时间漂移的持续分布变化,性能优于最先进的监督式检测器。
本文评估了多传感器融合在时间分布偏移下对牛姿态分类的稳健性,发现多模态模型性能显著下降,而更简单的单传感器模型泛化能力更好,揭示了捷径学习问题。
本文介绍了U-TTT,一种带有测试时训练层和双域适配的U型深度学习模型,用于在分布偏移下实现鲁棒的PET图像去噪,在不同剂量水平和扫描仪类型上均达到了最先进性能。
本文提出SCALE,一种面向智能体LLM工作流DAG的深度强化学习调度器,通过交叉注意力与结构化表示正则化,泛化至未见过的集群规模,无需重新训练即可降低响应时间。
本文提出了一个三阶段诊断框架,用于识别离线模型选择器为何无法胜过最佳单一模型,并将其应用于edX点击流数据上的辍学预测。研究发现瓶颈在于局部表征歧义,而非学习器选择或分布偏移,建议重新设计状态或收集新数据,而非进一步调优算法。
本文识别出分布偏移和规模约束是LLM基准审计中统计污染检测方法的关键失效模式。对27个模型评估三种范式的结果显示,在335次评估中仅有199次正确结果,表明存在系统性可靠性差距,使得这些方法无法替代透明数据溯源。
本文提出一个理论框架,用于量化当训练分布与部署分布因潜在体制动态(建模为马尔可夫切换过程)不同时的部署风险,提供了精确分解和有限样本边界。
介绍了TASER,一种从Langevin Stein算子导出的训练时正则化框架,它鼓励预测器与数据密度之间的几何兼容性,提高了CIFAR-10上的对抗鲁棒性和稳定性,而不会显著降低干净准确率。