generalization

标签

Cards List
#generalization

使用回放缓冲区重新审视难题 (8分钟阅读)

TLDR AI · 2026-06-19 缓存

ZPPO在LLMs/VLMs的强化学习中为难题引入了回放缓冲区,允许反复接触,逐步提高rollout准确性,而不会导致策略漂移。该方法比GRPO解决了更多难题,尤其是那些初始准确率接近零的问题。

0 人收藏 0 人点赞
#generalization

强化学习走向广泛且持久的受益模型(22分钟阅读)

TLDR AI · 2026-06-19 缓存

OpenAI研究人员表明,针对有益特质(诚实、透明、可纠正性)在现实场景中进行强化学习,能在数十个对齐基准上产生广泛改进,且这些改进能够泛化到训练领域之外,并在对抗压力下持续存在。

0 人收藏 0 人点赞
#generalization

@OpenAI:随着AI承担更长、风险更高的任务,我们希望模型能够将有益且安全的行为推广到新的领域,超越训练范围……

X AI KOLs · 2026-06-18 缓存

OpenAI发布了关于强化学习的研究,用于训练模型展现出诚实和可纠正性等有益特质,表明这种训练能够跨领域泛化,并在对抗性压力下持续存在。

0 人收藏 0 人点赞
#generalization

对齐隐含语句以提升隐含仇恨言论跨数据集泛化性:基于上下文有界半硬负样本挖掘

arXiv cs.CL · 2026-06-18 缓存

本文提出ImpSH,一种基于三元组的隐含仇恨言论分类框架,该框架将帖子与隐含语句对齐,并使用上下文有界半硬负样本挖掘来提高跨数据集的泛化能力。

0 人收藏 0 人点赞
#generalization

Grokking中权重范数控制什么?交叉熵下的对数几率尺度中介作用

arXiv cs.LG · 2026-06-18 缓存

本文研究在交叉熵损失下,权重范数是直接控制神经网络中的grokking延迟,还是其效果通过对数几率尺度和softmax饱和来中介。实验表明,延迟几乎完全由有效对数几率尺度解释,权重范数的贡献微乎其微。

0 人收藏 0 人点赞
#generalization

Robusto-2:在利马和纽约市对人与VLMs进行自动驾驶基准测试

Hugging Face Daily Papers · 2026-06-18 缓存

本文研究了自动驾驶系统与人类在不同地理位置(利马和纽约市)的视觉问答任务中的表现,发现人类和VLM无论地点如何都表现出相似的性能,但根据问题类型存在差异。

0 人收藏 0 人点赞
#generalization

Connect the Dots:通过强化学习训练LLM以具备跨域泛化能力的长期生命周期智能体

Hugging Face Daily Papers · 2026-06-18 缓存

本文介绍了Connect the Dots(CoD),这是一个通过强化学习训练LLM的框架,用于培养长期生命周期智能体的元能力,实现持续学习和跨域泛化。

0 人收藏 0 人点赞
#generalization

噪声驱动的亚稳态逃逸解释了深度神经网络中的Grokking现象

arXiv cs.LG · 2026-06-17 缓存

该论文提出,深度神经网络中的grokking现象源于一阶L2相变中噪声驱动的亚稳态逃逸,证明了延迟泛化遵循Arrhenius标度,并再现了典型的grokking曲线。

0 人收藏 0 人点赞
#generalization

SpeechDx:临床语音AI的多任务基准

arXiv cs.AI · 2026-06-17 缓存

SpeechDx 是一个大规模临床语音AI基准,涵盖12个数据集和27个任务,覆盖多种健康状况,并按语音生成阶段进行结构化。它评估了12种最先进的音频编码器,结果表明当前模型在临床语音领域无法可靠地泛化。

0 人收藏 0 人点赞
#generalization

无中生有:语言模型能否发现零?

arXiv cs.AI · 2026-06-17 缓存

本文探讨了语言模型能否独立发现零的概念,作为分布外泛化的一种形式。研究发现,GPT-2大小的模型在测试时无法做到,但通过零的示例训练后会有显著提升,并且语言预训练减少了所需示例的数量。

0 人收藏 0 人点赞
#generalization

通过自增强微调在Text-to-SQL中整合推理与泛化

arXiv cs.AI · 2026-06-16 缓存

本文提出CoTE-SQL,一种面向text-to-SQL的自增强微调框架,它整合了自推理轨迹、结构化思维链提示和执行反馈,在Spider和Bird基准上取得了最先进的性能。

0 人收藏 0 人点赞
#generalization

一种基于深度强化学习(DRL)的Transformer方法用于解决开放车间调度问题

arXiv cs.AI · 2026-06-15 缓存

介绍了一种基于Transformer的调度策略,该策略通过强化学习训练,用于开放车间调度问题,展示了在小规模实例上训练的模型能够泛化到更大规模的问题,并与经典调度启发式算法竞争。

0 人收藏 0 人点赞
#generalization

超越LoRA:稀疏诱导的适配是否更好?

arXiv cs.LG · 2026-06-15 缓存

本文提出了对LoRA的稀疏诱导适配方法,包括廉价LoRA(cLA)和链式循环变体(c³LA),并提供了理论泛化界以及实证评估,结果显示在保持竞争性性能的同时,训练时间最多减少10%,峰值GPU内存节省最多15%。

0 人收藏 0 人点赞
#generalization

权重范数确定Grokking时间尺度:一个因果延迟定律

arXiv cs.LG · 2026-06-15 缓存

本文证明权重范数因果性地控制神经网络中grokking的时间尺度,调和了相互矛盾的论述。通过干预实验,它表明grokking遵循指数延迟定律,且范数大小在不同架构中比学习率更主导grokking时间。

0 人收藏 0 人点赞
#generalization

后训练如何塑造生物学推理模型

Hugging Face Daily Papers · 2026-06-15 缓存

本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。

0 人收藏 0 人点赞
#generalization

检索,而非重新训练:在测试时将视觉语言动作模型扩展到新任务

Hugging Face Daily Papers · 2026-06-14 缓存

本文介绍了一种检索增强的视觉-语言-动作策略,通过使用预训练模型和索引演示,消除了每个任务的微调,实现了高效的跨本体泛化和测试时的任务适应。

0 人收藏 0 人点赞
#generalization

奇异学习理论:人工智能像冰融化一样学习

Reddit r/artificial · 2026-06-12 缓存

奇异学习理论(SLT)使用代数几何来解释为什么神经网络尽管存在退化性却能很好地泛化,引入了实对数规范阈值(RLCT)作为模型复杂度的度量。

0 人收藏 0 人点赞
#generalization

@BetaTomorrow: 标题:数据过滤的惨痛教训 作者:Christopher Mohri, John Duchi, Tatsunori Hashimoto (@tatsu_hashimo…

X AI KOLs Following · 2026-06-12 缓存

本文认为,对于足够大的模型,未经过滤的数据可以通过提供弱扰动来提高泛化能力,这与通常认为只有高质量过滤数据才有益的假设相反。作者提醒,有害的条件偏移仍可能损害模型,但过度筛选可能会去除有用的扰动。

0 人收藏 0 人点赞
#generalization

用于生物医学声明验证的小型LLM:经济高效的微调、结构化数据集捷径与跨域泛化

arXiv cs.CL · 2026-06-12 缓存

使用QLoRA对小型LLM(3B-7B)进行生物医学声明验证的微调,以44.5倍更低的成本实现了比GPT-4o和GPT-5更高的F1分数,并揭示了SciFact中的一个结构伪影。该研究表明,在结构合理的数据上进行训练可实现稳健的跨域迁移。

0 人收藏 0 人点赞
#generalization

@TheAhmadOsman: https://x.com/TheAhmadOsman/status/2064724789952958663

X AI KOLs Following · 2026-06-10 缓存

详细解释了为什么在基准测试、评估集或测试集上进行训练是机器学习中的大忌,这会破坏衡量泛化能力的能力。文章强调了干净的评估协议的重要性,并警告不要进行“benchmaxxing”。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈