何时重训练:在概念漂移、预算和延迟约束下流式机器学习重训练策略的实证研究

arXiv cs.LG 论文

摘要

本文实证研究了在概念漂移、预算和延迟约束下流式机器学习系统的重训练策略。

arXiv:2608.19488v1 公告类型:新 摘要:生产环境中的机器学习系统在概念漂移下会性能下降,但从业者几乎没有关于何时重训练的原则性指导。重训练成本高昂,重训练预算有限,并且重训练后的模型不会立即生效:训练和部署延迟导致过时的模型在服务预测,而数据持续变化。我们提出了一个受控的实证研究,比较了三种实用的模型刷新策略(周期性重训练、错误阈值触发和基于ADWIN的统计漂移触发重训练)与无重训练基线,在一个统一的系统模型下评估,该模型明确了重训练预算和训练加部署延迟。在跨越三种漂移状态、三种预算水平、最多五种延迟水平、三个数据集和两种学习模式的3,933次实验运行中,我们发现最重要的设计决策不是重训练策略,而是部署模型是否进行增量学习。在使用每样本增量更新的情况下,对于本文研究的具有即时标签的线性在线学习器,没有任何策略与无重训练基线在实际意义上显著不同,在54次配对比较中,即使在极端延迟下也是如此。在没有增量更新的情况下,策略选择导致漂移后准确率相差15-55个百分点,并且简单的周期性重训练在突然和渐进漂移下显著优于两种反应性策略,而反应性策略仅在重复漂移下保持优势。我们记录了反应性策略的系统性故障模式以及延迟预算队列交互作用,后者会悄无声息地将有效重训练预算减半,并发布了完整的模拟器、数据集管道和每次运行的产物以供重现性。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:23

# 重新训练何时进行:面向概念漂移、预算与延迟约束下流式机器学习的重新训练策略实证研究
来源:https://arxiv.org/abs/2608.19488
文献工具

## 文献与引用工具

文献浏览器切换

代码、数据、媒体

## 与本文关联的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

arXiv 推荐工具切换

关于 arXivLabs

## arXivLabs:与社区协作者共同推进的实验性项目

arXivLabs 是一个框架,允许协作者直接在我们的网站上开发和分享新的 arXiv 功能。

与 arXivLabs 合作的个人和组织都认同并接受我们的开放、社区、卓越及用户数据隐私价值观。arXiv 坚守这些价值观,并仅与遵守这些价值观的合作伙伴共事。

有一个能为 arXiv 社区创造价值的项目想法吗?**了解更多关于 arXivLabs 的信息**(https://info.arxiv.org/labs/index.html)。

相似文章

论想象训练

arXiv cs.LG

本文分析了基于模型的强化学习中的“想象训练”范式,推导了最优样本分配策略,并描述了动态模型和奖励模型的误差如何影响策略回报。