reinforcement-learning

标签

Cards List
#reinforcement-learning

基于强化学习的时延容忍网络中无人机飞行与机会路由联合优化

arXiv cs.AI · 4天前 缓存

本文提出了JUROR,一种基于强化学习的框架,在集中训练与分散执行的模式下,联合优化时延容忍网络中的无人机飞行路径和分散式机会路由。

0 人收藏 0 人点赞
#reinforcement-learning

@johnschulman2: 关于OpenAI智能体形成留言板:令人惊讶的是,它们发展出了如此强烈的“利他”驱动力来……

X AI KOLs Following · 4天前

John Schulman评论了OpenAI智能体意外发展出利他行为,推测这可能源于在平行子智能体设置上进行强化学习,并采用团队级奖励。

0 人收藏 0 人点赞
#reinforcement-learning

@seclink: 冷知识,RAG 技术的演进路径 ① 2020 — 基础 RAG(解决"知识不在模型里") 起点是 Lewis 等人的 RAG:DPR 稠密检索 + 向量相似度 + 生成。它第一次让 LLM 能"外接知识库",缓解幻觉和时效性问题。但这代是…

X AI KOLs Timeline · 4天前 缓存

科普了RAG技术从2020年基础RAG到2025-2026年自主智能体+强化学习的演进路径,涵盖检索精度提升、反思纠偏、图谱增强、路由优化与Agentic RAG等方向,并总结了各阶段代表性工作与痛点。

0 人收藏 0 人点赞
#reinforcement-learning

@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……

X AI KOLs Timeline · 4天前 缓存

一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。

0 人收藏 0 人点赞
#reinforcement-learning

SFT冲突,RL共存:LLM多任务学习的理论与实证分析

Hugging Face Daily Papers · 4天前 缓存

本文进行了理论与实证分析,表明SFT在多任务LLM训练中存在任务冲突,而RL能够实现稳定共存,并提出Parallel-RL范式以实现高效的多任务训练。

0 人收藏 0 人点赞
#reinforcement-learning

OneEmo:用于情绪感知、理解和交互的统一多模态推理模型

Hugging Face Daily Papers · 4天前 缓存

介绍了一款名为OneEmo的统一多模态推理模型,用于情绪感知、理解与交互,并同时介绍了EmoWorld-130K数据集和Emo-Chord强化学习策略。

0 人收藏 0 人点赞
#reinforcement-learning

ChronoVision:通过潜在状态重建进行时间推理

Hugging Face Daily Papers · 4天前 缓存

ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。

0 人收藏 0 人点赞
#reinforcement-learning

AgentOPSD:智能体强化学习中的递归自蒸馏

Hugging Face Daily Papers · 4天前 缓存

AgentOPSD 提出了一种无评论家的递归方法,用于智能体强化学习中的回合级信用分配,通过在 log-odds 空间中进行贝叶斯信念更新来重新加权结果。它在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,优于 GRPO 和自蒸馏基线。

0 人收藏 0 人点赞
#reinforcement-learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Hugging Face Daily Papers · 4天前 缓存

EnvACE 引入了世界预演,一种智能体强化学习方法,通过策略在内部预演环境响应来取代外部环境交互,在多个基准上取得了强劲性能。

0 人收藏 0 人点赞
#reinforcement-learning

RL Environments Are All You Need (6 minute read)

TLDR AI · 4天前 缓存

The author argues that RL environments serve as the essential data for building AI agents, enabling systematic training, prompt optimization, and evaluation rather than manual iteration.

0 人收藏 0 人点赞
#reinforcement-learning

@jacobpeake: Today, we're launching Standard Machines @stanmachines. We build reinforcement-learning environments for chip design. W…

X AI KOLs Following · 4天前 缓存

Standard Machines launches reinforcement-learning environments for chip design, aiming to accelerate tape-out and push frontier AI capabilities.

0 人收藏 0 人点赞
#reinforcement-learning

@latkins: 哟

X AI KOLs Following · 4天前 缓存

Prime Intellect 推出了 Prime Agent,一个用于编程和长期自主任务的自我改进型 RLM 框架,具备程序化工具调用、将上下文作为变量、多智能体消息传递以及可自我修改的框架状态等特点。

0 人收藏 0 人点赞
#reinforcement-learning

凸包邻域平滑对偶泛化:控制离线强化学习中的局部修正传播

arXiv cs.LG · 5天前 缓存

本文提出CSDG,一种离线强化学习方法,将Bellman备份表示为样本内目标加上凸包邻域局部修正,从而控制OOD动作估计误差并提高价值稳定性。

0 人收藏 0 人点赞
#reinforcement-learning

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

arXiv cs.LG · 5天前 缓存

SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.

0 人收藏 0 人点赞
#reinforcement-learning

重访不确定性下Q学习中的TD目标聚合

arXiv cs.LG · 5天前 缓存

本文提出SADQ,一种对Q学习的改进,利用动力学模型的一步轨迹预测来正则化TD目标聚合,减少自举引起的过估计,并在多个基准上提高训练稳定性。

0 人收藏 0 人点赞
#reinforcement-learning

通过结构感知策略学习内化学术写作工作流以生成引言

arXiv cs.CL · 5天前 缓存

本文提出StructPO,一种结构感知的策略学习框架,通过显式阶段标记和精炼引导优化,将多阶段学术写作工作流内化到单次LLM策略中,从而提高引言生成质量和效率。

0 人收藏 0 人点赞
#reinforcement-learning

SP3O:无需奖励建模的基于片段偏好的强化学习

arXiv cs.LG · 5天前 缓存

介绍SP3O,一种新颖的无需奖励模型、无需评论家的基于梯度的偏好强化学习算法,利用片段级偏好,在机器人控制和LLM微调中展现出改进的性能,尤其是在长时程任务中。

0 人收藏 0 人点赞
#reinforcement-learning

PAMT:面向多领域机器翻译的过程对齐强化学习

arXiv cs.CL · 5天前 缓存

本文提出PAMT,一种面向多领域机器翻译的过程对齐强化学习框架,将领域感知的长思维链监督与步骤级过程奖励相结合,以改进对领域敏感的翻译决策。

0 人收藏 0 人点赞
#reinforcement-learning

评分标准作为开放式生成中的特权信息

arXiv cs.LG · 5天前 缓存

本文介绍了评分标准作为特权信息(RuPI),通过以评分标准作为软特权信息来条件化教师模型,将同策略自蒸馏扩展到开放式生成。该方法在多个大语言模型和HealthBench等基准上优于评分标准即奖励的强化学习和参考补全蒸馏。

0 人收藏 0 人点赞
#reinforcement-learning

CVPO:通过值方差适应与动态课程学习增强LLM强化学习推理

arXiv cs.CL · 5天前 缓存

这篇arXiv论文介绍了CVPO,一种针对LLM的强化学习方法,它适应值方差以进行优势估计,并使用动态课程学习来匹配问题难度,在数学任务上取得了比VAPO更好的推理性能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈