reinforcement-learning

标签

Cards List
#reinforcement-learning

@DeFiMinty: AI系统能否持续为AI智能体生成更难的训练任务?腾讯的新研究表明可以。递归…

X AI KOLs Following · 23小时前 缓存

腾讯的一项新研究引入了递归合成终端任务(RST),这是一种逐步为AI智能体生成更难、可验证的训练任务的方法。从639个任务开始,它在15轮中生成了37,484个经过验证的任务,使用这些任务进行强化学习将Qwen3.5-27B在Terminal-Bench Hard上的性能从22.7%提升到32.0%。

0 人收藏 0 人点赞
#reinforcement-learning

@samsja19: 与多智能体一起到来的还有 prime-rl 0.8.0 版本,自 0.7.0 以来共有 13 位贡献者提交了 98 个 commit,菜单上有:1. 多智能体…

X AI KOLs Following · 昨天 缓存

Prime Intellect 发布了 prime-rl 0.8.0,增加了多智能体训练、Nixl 和 Model Express 权重广播、扩展的多模态支持,以及多项性能改进。

0 人收藏 0 人点赞
#reinforcement-learning

@samsja19:Prime RL 现在可以表示和训练多智能体系统,支持智能体裁判、自我对弈、用户模拟等用例…

X AI KOLs Following · 昨天 缓存

Prime RL 现在支持表示和训练多智能体系统,可实现智能体裁判、自我对弈、用户模拟以及复杂智能体协作等用例。

0 人收藏 0 人点赞
#reinforcement-learning

基于观测的自预测强化学习用于视觉连续控制

arXiv cs.LG · 昨天 缓存

本文提出了 OG-SPR,一种无模型视觉强化学习算法,它将潜在自预测与观测预测相结合,学习具有动力学感知的表示,从而在 DeepMind Control Suite 任务上提高了样本效率。

0 人收藏 0 人点赞
#reinforcement-learning

通过分层推理和话语级目标奖励增强LLMs的社交智能

arXiv cs.CL · 昨天 缓存

本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。

0 人收藏 0 人点赞
#reinforcement-learning

M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准

arXiv cs.CL · 昨天 缓存

本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。

0 人收藏 0 人点赞
#reinforcement-learning

LC-GRPO:利用朗之万校正弥合基于流的GRPO训练-推理差距

arXiv cs.LG · 昨天 缓存

本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。

0 人收藏 0 人点赞
#reinforcement-learning

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG · 昨天 缓存

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

0 人收藏 0 人点赞
#reinforcement-learning

IFlowNets:扩展生成采样器以在不完全信息博弈中学习策略

arXiv cs.LG · 昨天 缓存

本文介绍了IFlowNets,将对抗流网络扩展到不完全信息博弈,证明了先前的约束条件无效,并在初步实验中显示出与现有方法相当或更好的性能。

0 人收藏 0 人点赞
#reinforcement-learning

An Emerging Retail Portfolio Management Application: Personalized, Tax-Aware Reinforcement Learning with Natural Language Goals

arXiv cs.LG · 昨天 缓存

Presents an emerging retail portfolio management application that uses personalized, tax-aware reinforcement learning with natural language goal input, featuring a three-phase pipeline and integration with live brokerage APIs.

0 人收藏 0 人点赞
#reinforcement-learning

RA-CAD:为状态感知的文本到CAD生成学习执行后批判

arXiv cs.AI · 昨天 缓存

RA-CAD 提出了一种用于文本到CAD生成的状态感知智能体,采用生成-执行-批判-重写循环,并通过组相对策略优化进行反馈驱动的智能体优化。它在CADFusion和Text2CAD基准上实现了最先进的执行有效性和几何质量。

0 人收藏 0 人点赞
#reinforcement-learning

SkillHEX:通过假设驱动的自主探索与利用提升智能体技能

arXiv cs.AI · 昨天 缓存

SkillHEX提出了一种用于大语言模型智能体自主技能演化的闭环框架,利用假设驱动的自我验证和证据引导的树搜索来克服稀疏奖励挑战。在有限交互预算下,它在SkillsBench上优于现有自演化方法。

0 人收藏 0 人点赞
#reinforcement-learning

Search2Skill:通过基于规则表的强化学习在知识边界之外进行技能蒸馏

arXiv cs.AI · 昨天 缓存

Search2Skill 是一个框架,它训练 LLM 智能体识别能力差距、搜索外部来源,并使用基于规则表的强化学习将检索到的知识提炼为可复用的技能,在专家领域基准测试上优于基线方法。

0 人收藏 0 人点赞
#reinforcement-learning

@tobi:让我们都同意这是AGI的正确且最终的评估 https://jackhopkins.github.io/factorio-learning-environ…

X AI KOLs Timeline · 2天前 缓存

Factorio Learning Environment v0.3.0 是一个开源平台,用于在 Factorio 中评估 AI 智能体,增加了无头扩展、OpenAI Gym 兼容性以及用于实时演示的 Claude Code 集成。

0 人收藏 0 人点赞
#reinforcement-learning

@sheriyuo: Meta-RL 确实感觉是一个非常具有前景的方向

X AI KOLs Timeline · 2天前 缓存

一位研究者强调,Meta-RL 是训练 LLM 智能体的一个有前景的方向,将智能体训练重新构建为跨回合的元强化学习问题,从而实现主动探索和试错适应。

0 人收藏 0 人点赞
#reinforcement-learning

具有全局约束的激励广告生成式优化

arXiv cs.LG · 2天前 缓存

本文提出GOAL,一种约束感知的生成式激励广告框架,将激励分配建模为条件序列生成问题,并引入SCPO来学习一个能够跨ROI约束泛化的单一生成策略。实验表明,该方法在降低ROI违规率的同时,改善了长期收入和用户留存。

0 人收藏 0 人点赞
#reinforcement-learning

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

arXiv cs.LG · 2天前 缓存

Introduces SPOT, a method for on-policy distillation that uses sparse probing and outcome calibration to improve reasoning performance in smaller student models while balancing solution quality and coverage.

0 人收藏 0 人点赞
#reinforcement-learning

EASy:迈向基于LLM的高效智能体系统

arXiv cs.CL · 2天前 缓存

本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。

0 人收藏 0 人点赞
#reinforcement-learning

ATLAS:具有抽象后继的自适应拓扑学习用于持续学习

arXiv cs.LG · 2天前 缓存

本文介绍了ATLAS,一种基于模型的持续强化学习算法,该算法结合了Grow When Required网络与后继特征,以实现高样本效率和鲁棒的非平稳环境适应,并在空间导航任务中展示了正向后向迁移。

0 人收藏 0 人点赞
#reinforcement-learning

Adaptive Finite-Budget Training for CVaR Risk-Aware Q-Learning

arXiv cs.LG · 2天前 缓存

This paper proposes an adaptive training controller for CVaR risk-aware Q-learning, improving finite-budget behavior, reducing Bellman residuals by ~85%, and yielding better risk-adjusted performance in daily Bitcoin trading.

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈