overfitting

标签

Cards List
#overfitting

Beyond Full-Model Rollback: AuroSFT for Adapter-State Multi-Task Fine-Tuning

arXiv cs.LG · 2天前 缓存

AuroSFT introduces a parameter-efficient adapter-based framework for multi-task supervised fine-tuning that rolls back adapter checkpoints at task-wise peaks instead of full-model checkpoints, achieving higher average accuracy than mSFT.

0 人收藏 0 人点赞
#overfitting

为什么一个完美通过每个测试用例的智能体,在几百次真实对话后仍会偏离轨道?

Reddit r/AI_Agents · 2026-07-29

探讨了为什么在测试用例上表现完美的AI智能体在真实对话中常常失败,强调了分布偏移和过拟合等问题。

0 人收藏 0 人点赞
#overfitting

在样本量低于1万时,qlora的默认学习率2e-4是错误的,却没有人讨论[D]

Reddit r/MachineLearning · 2026-07-16

作者认为,对于样本量低于1万的数据集,QLoRA微调中常用的2e-4学习率过高,会导致过拟合和评估效果不佳,并建议使用更低的学习率,如1e-4。

0 人收藏 0 人点赞
#overfitting

重新审视智能体框架演进的评估

arXiv cs.AI · 2026-07-15 缓存

本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。

0 人收藏 0 人点赞
#overfitting

我们是否在合并正确的模型?专家训练时长对LLM模型合并的影响

arXiv cs.LG · 2026-07-15 缓存

本文挑战了关于模型合并中领域专家应训练至最优验证损失的常见假设,表明最优训练时长在很大程度上取决于合并方法。简单平均法会因过拟合而性能下降,而基于稀疏化的方法则能从超出最优点的训练中获益。研究建议训练时长与合并方法应联合选择。

0 人收藏 0 人点赞
#overfitting

缓解CTR模型中的早期训练崩溃

arXiv cs.LG · 2026-07-14 缓存

本文分析了用于点击率预测的深度神经网络模型中的早期训练崩溃现象,并提出了缓解策略,如稀疏特征移除和值过滤,在大规模工业数据集上展示了改进效果。

0 人收藏 0 人点赞
#overfitting

我们可以用SLMs压缩数据吗?

Reddit r/LocalLLaMA · 2026-07-03

探讨了是否可以通过刻意对训练数据进行过拟合来使用小型语言模型(SLMs)实现无损数据压缩,反思机器学习中通常对过拟合的厌恶。

0 人收藏 0 人点赞
#overfitting

低样本量下重新校准sEMG解码器时记忆化指标早期发现过拟合的适用性

arXiv cs.LG · 2026-06-29 缓存

本文探索了使用ReLU激活统计作为记忆化指标,在有限校准数据下微调sEMG解码器时检测过拟合,而无需验证集。

0 人收藏 0 人点赞
#overfitting

将900KB Transformer过拟合,把100MB CSV压缩到7MB

Hacker News Top · 2026-06-23 缓存

一位开发者使用一个小型900KB的Transformer模型进行过拟合,将100MB的CSV文件压缩到7MB,展示了一种使用过拟合神经网络进行数据压缩的新颖方法。

0 人收藏 0 人点赞
#overfitting

揭秘数据受限语言模型预训练中的训练时数据增强

Hugging Face Daily Papers · 2026-06-19 缓存

本文研究了在数据受限、算力充足的场景下,为缓解自回归语言模型预训练中的过拟合而采用训练时数据增强技术,发现结合词元级噪声、序列排列和目标偏移预测可以改善验证损失。

0 人收藏 0 人点赞
#overfitting

基于对数对齐比的训练时泛化诊断

arXiv cs.LG · 2026-05-29 缓存

本文介绍了对数对齐比(LAR),这是一种训练时度量,用于衡量参数-激活对齐度,并通过捕捉权重谱和激活谱的分散程度来预测泛化能力。在grokking和30亿参数语言模型上的实验表明,LAR能够跟踪从记忆到泛化的转变,并在无需留出数据的情况下标记过拟合。

0 人收藏 0 人点赞
#overfitting

R2R2: 通过自预测学习中的冗余减少实现鲁棒表示,用于密集经验重用

arXiv cs.LG · 2026-05-15 缓存

提出R2R2,一种用于强化学习中自预测学习的正则化方法,以缓解高更新-数据比下的过拟合,在连续控制任务上取得了显著改进。

0 人收藏 0 人点赞
#overfitting

降低学习率比任何其他尝试都更好地修复了我的Qlora微调问题

Reddit r/LocalLLaMA · 2026-05-14

一位用户发现,将学习率从2e-4降低到1e-4显著改善了Llama 3.1 8B在小型数据集(8k样本)上的QLoRA微调效果,防止了过拟合,并获得了更好的评估结果。

0 人收藏 0 人点赞
#overfitting

数据约束下的混合预训练缩放定律

arXiv cs.LG · 2026-05-14 缓存

本文研究了在混合预训练中稀缺目标数据与丰富通用数据之间的权衡,发现重复是驱动性能的关键因素,并且混合训练能容忍目标数据重复15-20次。我们引入了一个考虑重复影响的缩放定律,以优化数据约束条件下的混合配置。

0 人收藏 0 人点赞
#overfitting

数据受限训练的规定性缩放定律

Hugging Face Daily Papers · 2026-05-02 缓存

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。

0 人收藏 0 人点赞
#overfitting

量化强化学习中的泛化能力

OpenAI Blog · 2018-12-06 缓存

# 量化强化学习中的泛化能力 来源: [https://openai.com/index/quantifying-generalization-in-reinforcement-learning/](https://openai.com/index/quantifying-generalization-in-reinforcement-learning/) 我们训练了9个智能体来玩CoinRun,每个智能体都有不同数量的可用训练关卡。前8个智能体分别在包含100到16,000个关卡的数据集上进行训练。最后一个智能体在不受限制的关卡集合上进行训练,因此该智能体永远不会看到相同的关卡两次。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈