reinforcement-learning

标签

Cards List
#reinforcement-learning

FreedomIntelligence/HuatuoGPT-3-27B · Hugging Face

Reddit r/LocalLLaMA ↗ · 5小时前 缓存

HuatuoGPT-3-27B 是一个基于 Qwen3.8-27B 构建的医疗语言模型,采用单阶段策略优化 (OnePO),这是一种无需监督微调的强化学习领域适应方法。

0 人收藏 0 人点赞
#reinforcement-learning

量子云编排中成本与延迟权衡的量子强化学习

arXiv cs.LG ↗ · 21小时前 缓存

本文提出QRLQ,一种量子强化学习框架,该框架将参数化量子电路与dueling double deep Q-networks集成,以优化量子云编排中的成本与延迟权衡,实现在成本和延迟上优于启发式基线,同时参数量少于经典DRL。

0 人收藏 0 人点赞
#reinforcement-learning

基于反事实约束的多约束指令跟随在线策略蒸馏

arXiv cs.LG ↗ · 21小时前 缓存

本文提出CC-OPD,一种用于多约束指令跟随的新颖在线策略蒸馏方法,该方法使用反事实消融来增强训练信号,实现更优性能,其中1.5B模型在基准测试中超越其7B教师模型。

0 人收藏 0 人点赞
#reinforcement-learning

WTF?! 基于Wasserstein倾斜流图的无模拟强化学习

arXiv cs.LG ↗ · 21小时前 缓存

本文提出Wasserstein-Tilted Flow Maps(WTF),一种无需模拟的强化学习算法,用于微调基于流的生成模型以增强奖励对齐效果。该方法可在减少高达280倍计算量的情况下,实现比基线方法更高的奖励值。

0 人收藏 0 人点赞
#reinforcement-learning

多目标强化学习中后见重标注所致Preference Coverage Collapse研究

arXiv cs.LG ↗ · 21小时前 缓存

本文识别出'Preference Coverage Collapse'作为多目标强化学习后见重标注中的一种失败模式,并引入'her_mix'来缓解该问题,从而在各种设置下提升性能。

0 人收藏 0 人点赞
#reinforcement-learning

部分正确的工具缓存可能逆转组归一化策略更新

arXiv cs.LG ↗ · 21小时前 缓存

本文表明,在强化学习中,工具结果缓存即使只是略有正确,也可能逆转预期的组归一化策略更新,这一点通过数学分析和两个动作模型的实验得到了证实。

0 人收藏 0 人点赞
#reinforcement-learning

学习激活什么:面向长期多模态智能体的组合能力分配

arXiv cs.AI ↗ · 21小时前 缓存

本文介绍CoCA,一种用于长期多模态智能体动态能力分配的on-policy学习框架,通过条件比较和强化学习来解决计算开销和阶段依赖需求。

0 人收藏 0 人点赞
#reinforcement-learning

环境群胚的范畴内化在可推广POMDP求解中的应用

arXiv cs.AI ↗ · 21小时前 缓存

本文倡导使用范畴论和环境群胚来结构化部分可观测环境中的强化学习,利用对称性以提高样本效率和泛化能力。

0 人收藏 0 人点赞
#reinforcement-learning

SkillGym:使大语言模型内化人类技能以解决现实问题

arXiv cs.CL ↗ · 21小时前 缓存

SkillGym 将人类编写的智能体技能转化为可执行的训练环境,供大语言模型使用,从而实现监督微调和强化学习,以增强解决现实问题的能力和在基准测试中的性能。

0 人收藏 0 人点赞
#reinforcement-learning

Planned Test-Time Scaling 与协调推理路径

arXiv cs.CL ↗ · 21小时前 缓存

本文提出 Planned Test-Time Scaling (PTTS),一种通过协调推理分支来提升挑战性任务性能的方法,在数学推理基准测试中相比重复采样取得了显著提升。

0 人收藏 0 人点赞
#reinforcement-learning

恰当地归因:用于高效推理的冗余感知学习

arXiv cs.CL ↗ · 21小时前 缓存

本文介绍了 RECAP,一种冗余感知学习方法,通过根据步骤的结构角色和效能分配信用,提升了大型推理模型的效率,在提高准确性的同时减少了令牌使用量。

0 人收藏 0 人点赞
#reinforcement-learning

分解子任务强化学习 (RLDS)

arXiv cs.AI ↗ · 21小时前 缓存

本文介绍了基于分解子任务的强化学习(RLDS),该方法将轨迹奖励分解为每个子任务的优势,以改进语言模型智能体强化学习中的信用分配,并在高异质性智能体基准测试上显示出显著提升。

0 人收藏 0 人点赞
#reinforcement-learning

迈向机器人技术的通用后训练(18分钟阅读)

TLDR AI ↗ · 昨天 缓存

文章认为,机器人技术需要类似语言模型的后训练以实现高可靠性,并探讨了机器人系统中通用后训练面临的挑战和潜在方法。

0 人收藏 0 人点赞
#reinforcement-learning

Skild AI 通过模拟140年与自身过去版本的对练,训练了Unitree G1机器人踢足球。

Reddit r/singularity ↗ · 昨天

Skild AI 通过模拟140年与自身过去版本的对练,训练了Unitree G1机器人踢足球,展示了人工智能和机器人技术的重大进展。

0 人收藏 0 人点赞
#reinforcement-learning

针对智能电表隐私的多种推理攻击防御策略学习

arXiv cs.LG ↗ · 昨天 缓存

本文提出了一种代理引导分层强化学习框架,通过学习基于电池的负载整形策略来干扰非侵入式负载监测模式,从而防御针对智能电表数据的多种推理攻击。

0 人收藏 0 人点赞
#reinforcement-learning

校正优先级重放中的组内自我选择偏差

arXiv cs.LG ↗ · 昨天 缓存

本文识别了优先级经验回放中的组内自我选择偏差,并提出了兄弟感知方法来纠正结果分布扭曲,从而提高强化学习的学习效率。

0 人收藏 0 人点赞
#reinforcement-learning

Informed Masking:扩散大型语言模型中强化学习的结构感知扰动

arXiv cs.CL ↗ · 昨天 缓存

本文提出了Informed Masking(IM),一种针对扩散大型语言模型中强化学习的结构感知扰动方法,该方法优先处理下游令牌,提高了在数学和规划基准测试中的性能。

0 人收藏 0 人点赞
#reinforcement-learning

辨证、协同与安全:面向中医处方生成的结构化推理与知识驱动对齐

arXiv cs.CL ↗ · 昨天 缓存

本文提出一个渐进式四阶段框架,用于大语言模型生成中医处方,解决了结构化推理、纵向适应和安全合规方面的空白,其中一个7B模型在中医特定评估指标上零样本超越GPT-5。

0 人收藏 0 人点赞
#reinforcement-learning

ProcessLight: 面向基于大型语言模型的交通信号控制的过程监督

arXiv cs.AI ↗ · 昨天 缓存

ProcessLight 提出了一个基于大型语言模型的交通信号控制框架,该框架将决策分解为可验证的语义步骤,并采用逐步强化学习方法(STeP-PO)进行增强,以实现细粒度推理优化。

0 人收藏 0 人点赞
#reinforcement-learning

TelecomGPT-R1: 用于异构电信任务推理的统一后训练

arXiv cs.CL ↗ · 昨天 缓存

TelecomGPT-R1是一系列用于统一电信推理的开源模型,通过监督微调和强化学习训练,在基准测试中超越GPT-5等专有模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈