generalization

标签

Cards List
#generalization

Decoupled Descent:通过AMP Onsager修正强制实现精确的训练-测试误差追踪 [R]

Reddit r/MachineLearning · 13小时前

一篇理论论文,介绍了Decoupled Descent (DD),一种训练方法,它利用近似消息传递(AMP)的Onsager修正来在梯度下降过程中强制训练误差与测试误差之间的渐近相等,从而可能实现更好的停止和超参数调整。

0 人收藏 0 人点赞
#generalization

看到了那个用玫瑰花瓣讲归纳法的段子在流传。这是古德曼那个古老的“grue”问题的一个变体:你见过的每一颗祖母绿都是绿色的。那规则是“绿色”,还是“grue”——意思是直到某个日期之前是绿色,之后是蓝色?两种规则都符合你的所有观察。没有任何东西

Reddit r/AI_Agents · 昨天

文章讨论了古德曼的“grue”问题如何适用于生产环境中的AI智能体:在历史数据上表现完美并不能保证在未来数据上的正确性,而且更多数据也无法解决这种根本性的歧义。

0 人收藏 0 人点赞
#generalization

不漂移的AI科学家:四足导航研究循环中的品味、结构与可证伪发现

arXiv cs.AI · 昨天 缓存

这篇arXiv论文提出了一个AI科学家循环,用于研究四足机器人导航中的泛化,添加了实验卡片、专门化子代理以及一个名为kkanbu的偏好预言机,以防止漂移并保持自主研究的可证伪性。

0 人收藏 0 人点赞
#generalization

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

arXiv cs.CL · 2天前 缓存

This paper investigates why language models fail at two-hop generalization, showing that models succeed when the second hop follows training distribution but fail when it deviates, and proposes a recurrent-style training strategy to improve out-of-distribution two-hop reasoning.

0 人收藏 0 人点赞
#generalization

无攻击者的博弈:选择压力下LLM驱动搜索中的基准指纹识别

Hugging Face Daily Papers · 3天前 缓存

本文研究了LLM驱动的GPU内核进化优化如何对评估配置进行指纹识别,导致30%的分布内获胜结果在留出设置上失败。本文提供了失败模式的分类体系,以及战略优化下稳健基准测试的设计指南。

0 人收藏 0 人点赞
#generalization

为什么第三轴是自由

arXiv cs.LG · 5天前 缓存

本文认为探索性建模(XM)优化的是“自由”而非生成表达能力,证明更大的候选池会增加未命中概率和自由,实证结果表明基于自由的选择在分布偏移下能提升泛化能力。

0 人收藏 0 人点赞
#generalization

梯度下降早期动力学中逻辑回归的非渐近隐式偏差

arXiv cs.LG · 6天前 缓存

这篇理论论文研究了梯度下降下逻辑回归的非渐近隐式偏差,证明了参数向量能在与对齐误差相关的双指数次迭代内快速弱对齐最大间隔方向。

0 人收藏 0 人点赞
#generalization

立场:LLMs 无法跳跃

Hacker News Top · 6天前 缓存

一篇立场论文,认为大语言模型存在根本性局限,用“无法跳跃”这一隐喻来突出推理或泛化方面的不足。

0 人收藏 0 人点赞
#generalization

@johnschulman2:有趣的是,这些模型在网络评估中会陷入一种偏执狂般的暴怒状态。我想知道我们是否正在目睹『分块后训练』的实际效果……

X AI KOLs Following · 2026-08-05 缓存

约翰·舒尔曼的一条推文强调了论文《分块后训练》(Chunky Post-Training),该论文认为多样化的后训练数据集会导致模型学习到虚假相关性,从而引发非预期行为,例如拒绝以特定格式呈现的真实事实。论文引入了SURF和TURF来揭示并追踪前沿模型中的这些泛化失败。

0 人收藏 0 人点赞
#generalization

隐形捷径:视觉编码器为何洞悉你的相机

Hugging Face Daily Papers · 2026-08-05 缓存

本文识别了像素级别的隐形元数据痕迹,这些痕迹被视觉编码器用作捷径,导致在元数据分布偏移下出现性能下降。在预训练期间和之后采取的缓解策略,能降低对目标元数据和未见元数据的敏感性,同时不牺牲下游性能。

0 人收藏 0 人点赞
#generalization

MirrorCraft:在Minecraft隐藏规则变化下的配对评估

arXiv cs.AI · 2026-08-03 缓存

MirrorCraft 是一个配对基准,用于评估 Minecraft 中基于 LLM 的智能体在隐藏规则变化下的表现,使用匹配的 Vanilla 和 Mirror 世界,通过规则干预效应(RIE)测量性能变化。

0 人收藏 0 人点赞
#generalization

当基准测试推理无法组合时:AI评估中的可投射性

arXiv cs.AI · 2026-07-31 缓存

本文识别了AI基准评估中的一个非组合原则:对相邻投射的支持并不自动保证它们组合的合理性。文章提出了一种可投射性审计,用于诊断从基准到应用论证中缺乏支持的连接,并辅以一个法律研究案例和模拟实验。

0 人收藏 0 人点赞
#generalization

跨对齐训练、模型生物和玩具模型的共享SFT经验

arXiv cs.LG · 2026-07-30 缓存

本文研究将关于监督微调(SFT)的经验跨对齐训练、模型生物和玩具模型进行迁移,表明像基于行为原因的训练和混合模型内数据等技术可以改善泛化性和能力保持。

0 人收藏 0 人点赞
#generalization

@gp_pulipaka: 随机优化器。 #大数据 #分析 #数据科学 #AI #机器学习 #物联网 #工业物联网 #PyTorch #Python #RStats #Tensor…

X AI KOLs Timeline · 2026-07-28 缓存

本文讨论了一篇研究论文,该论文表明,使用不同随机种子训练的两个深度网络之间的分歧率可以仅使用未标记数据准确估计泛化误差,揭示了一个名为泛化分歧等式的惊人联系。

0 人收藏 0 人点赞
#generalization

梯度能量引导的逐块扰动用于锐度感知最小化

arXiv cs.LG · 2026-07-22 缓存

本文提出GEAR-SAM,通过使用平方梯度的指数移动平均来自适应地在网络块之间分配扰动预算,在不增加额外计算开销的情况下提升泛化能力。

0 人收藏 0 人点赞
#generalization

Building2Building:面向可泛化真实世界强化学习的大规模基准

arXiv cs.LG · 2026-07-21 缓存

介绍Building2Building(B2B),这是一个基于EnergyPlus构建、与Gymnasium兼容的大规模基准,用于研究强化学习中在真实HVAC控制环境下的泛化与迁移。

0 人收藏 0 人点赞
#generalization

减少随机优化中的每样本损害

arXiv cs.LG · 2026-07-21 缓存

本文介绍了一个在随机优化中减少每样本损害的框架,其中来自批次平均和历史状态的参数更新会增加单个样本的损失。该方法采用降维技术,并专注于最后一层线性层以提高效率,在图像分类任务上展示了更好的泛化性能。

0 人收藏 0 人点赞
#generalization

@swyx: 这里有一份非常值得注意的轨迹比较分析,隐藏在RLM论文中,来自 @a1zhang 和 @lateinteraction。一个公开的秘密…

X AI KOLs Following · 2026-07-21 缓存

讨论了一篇由 Alex Zhang 和 Omar 撰写的论文,该论文揭示了前沿模型如何通过训练测试集相似数据在基准测试中作弊,并提出了使用NLP距离度量方法对隐藏轨迹进行检测。

0 人收藏 0 人点赞
#generalization

@omarsar0:强烈推荐。我经常声称构建agent harnesses有巨大的alpha收益。结果发现harnesses是组合…

X AI KOLs Following · 2026-07-20 缓存

讨论了agent harnesses作为组合通用器的概念,用于模型中扩展泛化能力,并引用了RLM harness。

0 人收藏 0 人点赞
#generalization

@lateinteraction: “训练框架”开始与神经架构模糊,在谁承载实现泛化的归纳偏差方面…

X AI KOLs Timeline · 2026-07-20 缓存

研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈