标签
一篇理论论文,介绍了Decoupled Descent (DD),一种训练方法,它利用近似消息传递(AMP)的Onsager修正来在梯度下降过程中强制训练误差与测试误差之间的渐近相等,从而可能实现更好的停止和超参数调整。
文章讨论了古德曼的“grue”问题如何适用于生产环境中的AI智能体:在历史数据上表现完美并不能保证在未来数据上的正确性,而且更多数据也无法解决这种根本性的歧义。
这篇arXiv论文提出了一个AI科学家循环,用于研究四足机器人导航中的泛化,添加了实验卡片、专门化子代理以及一个名为kkanbu的偏好预言机,以防止漂移并保持自主研究的可证伪性。
This paper investigates why language models fail at two-hop generalization, showing that models succeed when the second hop follows training distribution but fail when it deviates, and proposes a recurrent-style training strategy to improve out-of-distribution two-hop reasoning.
本文研究了LLM驱动的GPU内核进化优化如何对评估配置进行指纹识别,导致30%的分布内获胜结果在留出设置上失败。本文提供了失败模式的分类体系,以及战略优化下稳健基准测试的设计指南。
本文认为探索性建模(XM)优化的是“自由”而非生成表达能力,证明更大的候选池会增加未命中概率和自由,实证结果表明基于自由的选择在分布偏移下能提升泛化能力。
这篇理论论文研究了梯度下降下逻辑回归的非渐近隐式偏差,证明了参数向量能在与对齐误差相关的双指数次迭代内快速弱对齐最大间隔方向。
约翰·舒尔曼的一条推文强调了论文《分块后训练》(Chunky Post-Training),该论文认为多样化的后训练数据集会导致模型学习到虚假相关性,从而引发非预期行为,例如拒绝以特定格式呈现的真实事实。论文引入了SURF和TURF来揭示并追踪前沿模型中的这些泛化失败。
本文识别了像素级别的隐形元数据痕迹,这些痕迹被视觉编码器用作捷径,导致在元数据分布偏移下出现性能下降。在预训练期间和之后采取的缓解策略,能降低对目标元数据和未见元数据的敏感性,同时不牺牲下游性能。
MirrorCraft 是一个配对基准,用于评估 Minecraft 中基于 LLM 的智能体在隐藏规则变化下的表现,使用匹配的 Vanilla 和 Mirror 世界,通过规则干预效应(RIE)测量性能变化。
本文识别了AI基准评估中的一个非组合原则:对相邻投射的支持并不自动保证它们组合的合理性。文章提出了一种可投射性审计,用于诊断从基准到应用论证中缺乏支持的连接,并辅以一个法律研究案例和模拟实验。
本文研究将关于监督微调(SFT)的经验跨对齐训练、模型生物和玩具模型进行迁移,表明像基于行为原因的训练和混合模型内数据等技术可以改善泛化性和能力保持。
本文讨论了一篇研究论文,该论文表明,使用不同随机种子训练的两个深度网络之间的分歧率可以仅使用未标记数据准确估计泛化误差,揭示了一个名为泛化分歧等式的惊人联系。
本文提出GEAR-SAM,通过使用平方梯度的指数移动平均来自适应地在网络块之间分配扰动预算,在不增加额外计算开销的情况下提升泛化能力。
介绍Building2Building(B2B),这是一个基于EnergyPlus构建、与Gymnasium兼容的大规模基准,用于研究强化学习中在真实HVAC控制环境下的泛化与迁移。
本文介绍了一个在随机优化中减少每样本损害的框架,其中来自批次平均和历史状态的参数更新会增加单个样本的损失。该方法采用降维技术,并专注于最后一层线性层以提高效率,在图像分类任务上展示了更好的泛化性能。
讨论了一篇由 Alex Zhang 和 Omar 撰写的论文,该论文揭示了前沿模型如何通过训练测试集相似数据在基准测试中作弊,并提出了使用NLP距离度量方法对隐藏轨迹进行检测。
讨论了agent harnesses作为组合通用器的概念,用于模型中扩展泛化能力,并引用了RLM harness。
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。