sample-efficient

标签

Cards List
#sample-efficient

Dreamer-SAC:在潜在世界模型中进行离策略学习以实现样本高效的自动驾驶

arXiv cs.LG · 昨天 缓存

本文提出Dreamer-SAC,一种基于模型的强化学习框架,将递归状态空间世界模型与潜在空间中的软演员-评论家算法相结合,以实现样本高效的自动驾驶。该框架在需要更少的真实环境交互的情况下,优于DreamerV3、SAC和PPO基线。

0 人收藏 0 人点赞
#sample-efficient

基于智能体经验的高效样本学习

Hugging Face Daily Papers · 2026-07-23 缓存

提出Experience Distillation方法,该方法将在智能体交互历史中通过上下文学习获得的增益内化到模型权重中,无需额外的环境交互,在软件工程和文字冒险任务上实现了显著的样本效率提升。

0 人收藏 0 人点赞
#sample-efficient

@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……

X AI KOLs Timeline · 2026-07-09 缓存

TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。

0 人收藏 0 人点赞
#sample-efficient

基于贝叶斯优化的节能强化学习样本高效帕累托前沿建模

arXiv cs.LG · 2026-07-07 缓存

本文提出了一种多目标贝叶斯优化方法,用于自动化强化学习中的权重选择以实现节能控制,并在物理Quanser Aero 2测试平台上展示了优于网格搜索的样本效率。

0 人收藏 0 人点赞
#sample-efficient

Agentic-Ideation:面向科学构想智能体的样本高效轨迹合成方法

arXiv cs.AI · 2026-07-01 缓存

提出了Agentic-Ideation框架,用于高效合成智能体轨迹以训练LLMs进行科学构想,实现了超过10倍的样本效率提升,并优于现有的基于工作流的基线方法。

0 人收藏 0 人点赞
#sample-efficient

AC-ODM: Actor-Critic在线数据混合方法用于样本高效的大语言模型预训练

Hugging Face Daily Papers · 2026-06-14 缓存

AC-ODM 使用强化学习动态优化大语言模型的预训练数据组成,实现了更快的收敛速度和更高的下游任务准确率,且计算开销可忽略不计。

0 人收藏 0 人点赞
#sample-efficient

用于LEGO空间物理推理的高效样本后训练

arXiv cs.LG · 2026-06-09 缓存

本文发现了一种基于LLM的LEGO组装生成中的失败模式PhysHack,并提出PVPO,一种结合基于模型的数据选择的高效样本强化学习方法,仅使用一小部分训练数据即可改善物理和语义对齐。

0 人收藏 0 人点赞
#sample-efficient

ChainzRule:跨表格、NLP与视觉任务的样本高效、鲁棒的深度学习

arXiv cs.LG · 2026-05-26 缓存

ChainzRule 提出了一种具有可学习多项式层和微分正则化的神经架构,在表格、NLP和视觉任务上实现了样本高效且鲁棒的性能,在Pima Diabetes、SST-5、Yelp Full和CIFAR-10-C数据集上取得了成果。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈