generalization

标签

Cards List
#generalization

@a1zhang: Transformer难以泛化到未明确训练过的任务。相反,我们在2026年提出,它…

X AI KOLs Following · 2026-07-20 缓存

文章提出,通过精心设计的harness来诱导组合,Transformer可以泛化到新任务,而无需模型本身具备泛化能力。研究表明,RLMs可以从短任务泛化到8-32倍长的任务,并且跨领域泛化。

0 人收藏 0 人点赞
#generalization

Bifocal Attention: 协调几何与频谱位置嵌入以实现算法泛化

arXiv cs.CL · 2026-07-20 缓存

本文介绍了Bifocal Attention,它将位置编码解耦为几何(标准RoPE)和频谱(Learnable Harmonic Operators)两种模态,以解决固定RoPE的'Spectral Rigidity'问题,从而改善超出训练窗口的算法泛化能力。

0 人收藏 0 人点赞
#generalization

递归自我改进的首个实验证据(3分钟阅读)

TLDR AI · 2026-07-16 缓存

研究人员展示了AIDE²,这是一个具有递归自动研究循环的系统,在超过100次迭代中改进了自己的代码,发现了七项改进,并在保留的基准测试上击败了手动调优的智能体。

0 人收藏 0 人点赞
#generalization

基于表示锚定与语言-动作对齐的泛化VLA微调

Hugging Face Daily Papers · 2026-07-15 缓存

Anchor-Align通过视觉-语言锚定增强行为克隆,以保留预训练表示和语言-动作对齐,在xArm7上使真实机器人成功率提升超过20%,并在模拟基准测试中持续取得改进。

0 人收藏 0 人点赞
#generalization

对比弱到强泛化

arXiv cs.CL · 2026-07-13 缓存

介绍了对比弱到强泛化(ConG)框架,该框架利用对比解码从弱模型生成更高质量的样本,以实现更可靠的弱到强泛化,并在多个模型族上展示了一致的改进。

0 人收藏 0 人点赞
#generalization

@nasqret: 我最近几周一直在进行大量自动研究实验,尤其是在代数领域。以下是一些…

X AI KOLs Timeline · 2026-07-10 缓存

作者分享了在代数自动研究实验中的观察,指出AI模型能够生成代码并发现新颖的抽象规则,从而产生人类难以理解的潜在陌生数学。

0 人收藏 0 人点赞
#generalization

贝叶斯扩散模型中泛化相变的精确信息理论

arXiv cs.LG · 2026-07-10 缓存

本文引入了分析可解的贝叶斯信息受限扩散(BIRD)模型,用于研究扩散模型中的记忆-泛化相变,发现生成过程接近记忆边缘,且信息限制有助于规避维度灾难。

0 人收藏 0 人点赞
#generalization

评估基础模型在极端环境事件中的泛化能力:以加州野火PM2.5为例

arXiv cs.LG · 2026-07-10 缓存

本文系统评估了时间序列基础模型(TSFMs)在预测野火烟雾导致的极端PM2.5浓度方面的表现,使用了加州12年的数据集。结果表明,像BiLSTM这样完全训练的循环基线模型优于TSFMs,挑战了更大预训练模型主导环境预测的假设。

0 人收藏 0 人点赞
#generalization

从机制上理解大语言模型微调中记忆知识无法泛化的原因

arXiv cs.AI · 2026-07-10 缓存

本文形式化了大语言模型微调中的“知道-使用鸿沟”,即模型记忆事实但无法泛化。引入了自修补干预方法,并确定知识回路错位为根本原因,通过简单启发式方法恢复了58-75%的泛化失败。

0 人收藏 0 人点赞
#generalization

面向推理泛化的几何自蒸馏

arXiv cs.LG · 2026-07-09 缓存

本文介绍了GeoSD,一种几何自蒸馏目标,采用Hellinger损失和近端Fisher-Rao距离项来对抗在线策略自蒸馏中的漂移,在不同模型规模上将分布外推理准确率提升了5.7–8.6个百分点。

0 人收藏 0 人点赞
#generalization

利用外梯度实现深度学习中的有效Sharpness-Aware Minimization

arXiv cs.LG · 2026-07-08 缓存

提出EISAM,一种新的优化器,通过使用外梯度步骤扩展Sharpness-Aware Minimization,寻找更平坦的最小值,从而改进泛化能力和鲁棒性,同时降低对超参数的敏感性。在基准测试上优于SGD、Adam和SAM。

0 人收藏 0 人点赞
#generalization

RMISC:用于时间序列基础模型的大规模真实世界多变量语料库

arXiv cs.AI · 2026-07-08 缓存

介绍RMISC,一个包含约200个数据集和1420亿个时间点的大规模真实世界多变量时间序列语料库,并证明在真实世界多变量数据上预训练时间序列基础模型相比合成数据能提升零样本泛化能力。

0 人收藏 0 人点赞
#generalization

通过直接在线策略蒸馏实现弱到强泛化

Hugging Face Daily Papers · 2026-07-08 缓存

Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。

0 人收藏 0 人点赞
#generalization

一种AI策略驱动20种不同机器人本体,从单臂到全尺寸人形机器人,全部完全自主运行

Reddit r/singularity · 2026-07-07

一种单一的AI策略已被开发出来,能够控制20种不同的机器人本体,范围从单臂到全尺寸人形机器人,实现完全自主运行。

0 人收藏 0 人点赞
#generalization

语言模型中风险规避的分布外泛化

arXiv cs.LG · 2026-07-07 缓存

本文介绍了RiskAverseOOD,一个用于衡量在低风险赌注中习得的风险规避行为如何泛化到语言模型中天文级别高风险赌注的基准。初步结果表明,像Qwen3-8B这样的模型能够部分地将风险规避泛化跨越98个数量级,但尚不足以可靠地作为安全故障保险。

0 人收藏 0 人点赞
#generalization

@adiba_ejaz: 因果(和统计)模型如何泛化到相互作用对象的新颖组合?我们与 @eliasbare… 的工作

X AI KOLs Timeline · 2026-07-04 缓存

这篇在ICML上发表的论文探讨了因果和统计模型如何泛化到相互作用对象的新颖组合,并在会议期间安排了一场海报展示。

0 人收藏 0 人点赞
#generalization

三思而后行:将树搜索蒸馏为冻结VLA模型的动作评估

Hugging Face Daily Papers · 2026-07-04 缓存

提出了SVA框架,该框架在冻结的VLA模型中将动作生成与后果评估解耦,使用蒙特卡洛树搜索并将其蒸馏为轻量级Q值模型,从而提升泛化能力和任务成功率,同时降低计算成本。

0 人收藏 0 人点赞
#generalization

训练Transformer:初始化时每层权重W = V·Uᵀ,揭示语料库确定的最优秩 — 寻找arXiv背书人 (cs.LG) [D]

Reddit r/MachineLearning · 2026-07-03

本文为Transformer提出原生因子化权重(Native Factorized Weights),即每个线性层从初始化开始就训练为两个低秩矩阵的乘积。实验表明,存在一个由语料库决定的最优秩,可最小化验证损失,并形成一个泛化区间,以更少的参数超越密集基线模型。

0 人收藏 0 人点赞
#generalization

分散损失抵消小型语言模型中的嵌入凝聚

Hacker News Top · 2026-07-03 缓存

本文观察到小型语言模型中的词元嵌入会凝聚成一个狭窄的锥形子空间,这种现象称为嵌入凝聚,并提出一种分散损失来抵消它,从而改善泛化能力。

0 人收藏 0 人点赞
#generalization

关于偏好对齐生成中导向向量局限性的研究

arXiv cs.CL · 2026-07-03 缓存

本文系统研究了导向向量在受控文本生成中的局限性,发现其有效性在不同特质间存在差异,在任务迁移中会退化,并面临组合权衡问题。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈