generalization

标签

Cards List
#generalization

揭示拜占庭鲁棒性下隐私对泛化的非单调影响

arXiv cs.LG · 2026-07-03 缓存

本文揭示了在拜占庭鲁棒分布式学习中隐私对泛化误差的非单调影响:在高噪声(强隐私)区域,增加隐私会降低泛化误差;而在低噪声(弱隐私)区域,增加隐私则会恶化泛化效果。

0 人收藏 0 人点赞
#generalization

智能体能否泛化到开放世界?揭示工具使用中静态训练的脆弱性

arXiv cs.AI · 2026-07-02 缓存

本文介绍了OpenAgent,这是一个针对开放世界场景中工具使用智能体在分布偏移下的问题设置,并提出了扰动增强微调(Perturbation-Augmented Fine-Tuning)来提高鲁棒性。实验表明,在环境变化下,SFT和RL智能体均会出现性能下降。

0 人收藏 0 人点赞
#generalization

学习可泛化的技能策略,基于数据高效的无监督强化学习

arXiv cs.LG · 2026-07-02 缓存

提出GenDa,一个统一的无监督强化学习框架,通过技能重新标记和互补信息瓶颈解决了非平稳技能语义和脆弱泛化问题,显著提高了数据效率和泛化能力。

0 人收藏 0 人点赞
#generalization

大气再入期间航天器姿态控制的深度强化学习

arXiv cs.LG · 2026-07-01 缓存

本文探讨了深度强化学习在航天器高超声速再入期间姿态控制中的应用。研究表明,最先进的强化学习和混合控制器能够优于采用增益调度的传统PID控制器,尤其是在使用动力学随机化来增强鲁棒性和泛化能力时。

0 人收藏 0 人点赞
#generalization

重新审视体积假说

arXiv cs.LG · 2026-07-01 缓存

本文重新审视了体积假说,该假说认为过参数化网络的泛化能力主要归因于权重空间中良好泛化区域更大的体积,而非SGD的隐式偏差。通过对二元网络的实验,作者表明,随着训练数据规模的增大,梯度学习相对于随机采样的泛化优势逐渐减弱,这可能解决了先前相互矛盾的发现。

0 人收藏 0 人点赞
#generalization

基于梯度反转和变分信息瓶颈的欺骗检测语言偏见缓解

arXiv cs.CL · 2026-07-01 缓存

本文提出了一种语言不变的欺骗检测框架,采用师生对抗学习和变分信息瓶颈来缓解语言偏见,在九个数据集上实现了高达36.2%的相对等错误率降低。

0 人收藏 0 人点赞
#generalization

锐度与复杂度能联合解释泛化到何种程度?

arXiv cs.LG · 2026-06-30 缓存

本文研究锐度与复杂度共同解释深度神经网络泛化能力的程度,引入基于帕累托的分析和面向函数的定义,以扩展解释范围。

0 人收藏 0 人点赞
#generalization

面向平坦极小值的闭式最速下降方向:降低神经网络损失Hessian特征谱的上界

arXiv cs.LG · 2026-06-30 缓存

推导了损失Hessian特征谱的Wolkowicz-Styan上界的闭式梯度,以引导神经网络训练朝向平坦极小值,并提出了Hessian谱范围(HSR)正则化。数值实验表明,HSR收窄了Hessian特征值范围,避免了尖锐极小值和鞍点,并实现了与Sharpness-Aware Minimization(SAM)相当的解。

0 人收藏 0 人点赞
#generalization

@dair_ai: 新论文:让LLM智能体获得经验,同时改进权重并保持可读性。智能体经验…

X AI KOLs Following · 2026-06-26 缓存

JERP 提出了一种方法,让LLM智能体从相同的交互轨迹中联合学习可解释的自然语言规则并更新策略参数,在AlfWorld和WebShop上提升了性能,同时保持了可检查性。

0 人收藏 0 人点赞
#generalization

理解边缘:稀疏自编码器追踪Transformer泛化的界限

arXiv cs.LG · 2026-06-26 缓存

本文提出使用稀疏自编码器检测Transformer的分布外输入,包括拼写错误和越狱提示,通过分析虚假概念激活。该方法实现了一种基于机制的微调策略,以提高LLM的鲁棒性。

0 人收藏 0 人点赞
#generalization

基于方向锐度的机器学习模型认证

arXiv cs.LG · 2026-06-25 缓存

本文提出方向锐度这一新指标,用于认证机器学习模型的泛化性能。该指标计算高效,且比测试准确率或传统锐度等现有近似指标更可靠,即便训练过程偏离预定程序也是如此。

0 人收藏 0 人点赞
#generalization

多传感器融合泛化失败:动物级别和时间分布偏移下的牛姿态分类

arXiv cs.LG · 2026-06-25 缓存

本文评估了多传感器融合在时间分布偏移下对牛姿态分类的稳健性,发现多模态模型性能显著下降,而更简单的单传感器模型泛化能力更好,揭示了捷径学习问题。

0 人收藏 0 人点赞
#generalization

SAM2Matting: 通用图像与视频抠图

Hugging Face Daily Papers · 2026-06-25 缓存

SAM2Matting 引入了一种从追踪到抠图的框架,通过区域建议桥接和抠图头增强 SAM2 等基础追踪器,即使在仅用图像训练的情况下,也能实现最先进的视频抠图性能,并在多样场景中展现出强大的泛化能力。

0 人收藏 0 人点赞
#generalization

历经考验:在陌生环境中重新评估智能体的能力

Hugging Face Daily Papers · 2026-06-25 缓存

GauntletBench是一个新的基于网页的基准测试,用于评估AI智能体在挑战性场景中的表现,重点关注时间感知、图形理解和3D推理。结果表明,最先进的智能体成功率仅为19.1%,而非专业人士则超过80%,凸显了当前智能体系统的显著局限性。

0 人收藏 0 人点赞
#generalization

强化学习:迈向广泛且持续有益的人工智能模型

arXiv cs.AI · 2026-06-24 缓存

这篇来自OpenAI的论文研究了基于有益行为的强化学习能否产生超越训练分布的广泛且持久的对齐泛化。通过使用一个包含真实场景的数据集,他们表明,对有益特质进行强化训练能够提升分布外的对齐能力,并增强对对抗性攻击的持久抵抗力。

0 人收藏 0 人点赞
#generalization

基于约束流形控制的安全且可泛化的分层多智能体强化学习

arXiv cs.AI · 2026-06-24 缓存

本文提出了一种分层多智能体强化学习框架,该框架通过低层的约束流形强制执行硬安全约束,同时通过高层策略学习实现有效协调,提供了理论上的安全保障,并实现了近乎完美的安全率和良好的泛化能力。

0 人收藏 0 人点赞
#generalization

削减视觉世界建模评估的长尾

Hugging Face Daily Papers · 2026-06-23 缓存

本文介绍了Tailor-Bench,这是一个系统评估视觉世界模型在不规则物理交互上的基准,揭示了泛化中的长尾差距:模型在常见场景上表现良好,但在非常规和不可能场景上性能下降。

0 人收藏 0 人点赞
#generalization

eCNNTO:一种高度可泛化的卷积网络,用于加速拓扑优化

arXiv cs.AI · 2026-06-20 缓存

本文提出了eCNNTO,一种带有残差连接的卷积神经网络,通过从早期迭代历史中预测接近最优的密度来加速基于密度的拓扑优化,实现了最多97%的迭代次数减少,并在不同边界条件、几何形状和网格分辨率下展现出强大的泛化能力。

0 人收藏 0 人点赞
#generalization

EBench:通用移动操作策略的基础诊断

Hugging Face Daily Papers · 2026-06-20 缓存

EBench 是一个用于通用移动操作策略的诊断基准,提供跨越26个任务和4个泛化维度的多维度概况,揭示超出总体成功率的架构性优缺点。

0 人收藏 0 人点赞
#generalization

@seclink: https://x.com/seclink/status/2067970118873993482

X AI KOLs Following · 2026-06-19 缓存

当前主流纯数据驱动机器人方案存在数据效率低、泛化性差的缺陷,新提出的神经符号物理智能范式将任务拆分为世界建模和规划两步,仅需1-10个演示即可学会新任务,泛化能力远超传统端到端方案,为通用机器人提供了更可靠的路径。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈