policy-learning

标签

Cards List
#policy-learning

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG · 3天前 缓存

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

0 人收藏 0 人点赞
#policy-learning

通过结构感知策略学习内化学术写作工作流以生成引言

arXiv cs.CL · 5天前 缓存

本文提出StructPO,一种结构感知的策略学习框架,通过显式阶段标记和精炼引导优化,将多阶段学术写作工作流内化到单次LLM策略中,从而提高引言生成质量和效率。

0 人收藏 0 人点赞
#policy-learning

SG-WAM:几何感知策略空间中的自引导世界建模

Hugging Face Daily Papers · 2026-08-02 缓存

本文提出SG-WAM,一种自引导框架,用于直接在策略派生的表示空间中学习几何感知的、以动作为条件的世界模型。它在LIBERO和LIBERO-Plus基准测试上取得了最先进的成功率,在真实世界评估中超越了强基线。

0 人收藏 0 人点赞
#policy-learning

HiFi-UMI:仅依靠高保真UMI数据学习可部署的操作策略

Hugging Face Daily Papers · 2026-07-28 缓存

HiFi-UMI引入了一种便携式数据采集系统,用于无机器人的UMI数据,通过立体惯性SLAM和广角摄像头实现了高轨迹精度。仅依靠这些数据训练操作策略即可在真实机器人上实现零样本部署,其性能在多个模型家族中达到或超越了遥操作基线。作者还开源了一个2000小时的高保真数据集。

0 人收藏 0 人点赞
#policy-learning

从智能体失败到文本策略:有效与失效之处

arXiv cs.CL · 2026-07-24 缓存

本文探讨了基于文本的优化(TextGrad)为何在语言智能体上失败,表明虽然冻结的智能体能够遵循良好的策略,但它们无法可靠地从自身的轨迹中学习和选择策略。

0 人收藏 0 人点赞
#policy-learning

图约束策略学习用于极端临床代码预测

arXiv cs.LG · 2026-07-15 缓存

提出了一种图约束遍历策略,将ICD-10-CM代码预测重构为在剪枝后的代码层级上的有限时域决策过程,在MIMIC-IV出院小结上优于平面基线。

0 人收藏 0 人点赞
#policy-learning

BlockPilot: 实例自适应策略学习用于基于扩散的投机解码

Hugging Face Daily Papers · 2026-06-30 缓存

BlockPilot 提出了一种实例自适应策略,用于预测基于扩散的投机解码的最优块大小,从而以最小的开销实现显著的加速。

0 人收藏 0 人点赞
#policy-learning

SimFoundry:模块化与自动化场景生成用于策略学习与评估

Hugging Face Daily Papers · 2026-06-26 缓存

SimFoundry 是一个模块化系统,可从视频自动化真实到仿真场景构建,生成数字孪生体并保留功能属性的变体,用于零样本机器人策略训练,实现了向真实世界任务的强迁移和高仿真到真实性能预测。

0 人收藏 0 人点赞
#policy-learning

用于机器人操作的 World Value Models

Hugging Face Daily Papers · 2026-06-23 缓存

本文提出了World Value Model (WVM),一种通用机器人价值模型,它将世界模型与价值估计相结合,以准确评估任务进展,并从混合质量数据中改进机器人策略学习,在标准基准和新的次优数据基准上取得了最先进的结果。

0 人收藏 0 人点赞
#policy-learning

@omarsar0: // 自动化 SKILL.md 生成 // 越来越多的挖掘会话是提升智能体的最佳方式之一。打开…

X AI KOLs Following · 2026-06-19 缓存

这篇来自麻省理工学院和哈佛大学的论文探讨了通过挖掘 GUI 交互轨迹来自动化生成 SKILL.md,发现聚类结果可读性强,但未能提升跨领域的策略性能。

0 人收藏 0 人点赞
#policy-learning

PoLAR: 因子化潜动作中的范围与模式以用于机器人策略学习

Hugging Face Daily Papers · 2026-06-19 缓存

PoLAR 在双曲空间中引入了一种具有几何结构的潜动作表示,将转换范围与模式分离,从而提升机器人策略学习性能。

0 人收藏 0 人点赞
#policy-learning

@HuggingPapers:用于机器人策略学习的几何动作模型,复用几何基础模型作为感知的骨干网络…

X AI KOLs Following · 2026-06-16 缓存

几何动作模型将几何基础模型用于机器人策略学习,在LIBERO-Plus上达到85.5%的准确率,推理仅需6.9毫秒,比基线模型快55倍。

0 人收藏 0 人点赞
#policy-learning

Geometric Action Model 用于机器人策略学习

Hugging Face Daily Papers · 2026-06-15 缓存

Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。

0 人收藏 0 人点赞
#policy-learning

Light-WAM:基于状态融合动作解码的高效世界动作模型

Hugging Face Daily Papers · 2026-06-06 缓存

Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。

0 人收藏 0 人点赞
#policy-learning

DiffAero:一个用于高效四旋翼策略学习的GPU加速可微仿真框架

arXiv cs.AI · 2026-06-04 缓存

DiffAero 是一个面向四旋翼控制策略学习的GPU加速、完全可微仿真框架,支持环境级与智能体级并行、多种动力学模型以及可定制传感器。它能够在消费级硬件上数小时内完成鲁棒飞行策略的学习,并以开源形式发布。

0 人收藏 0 人点赞
#policy-learning

能力自我评估:教会LLMs认识自身局限

arXiv cs.AI · 2026-06-02 缓存

本文针对大语言模型提出了能力自我评估(CSA)方法,并将其建模为策略学习问题。实验表明,强化学习能够有效教会模型识别自身局限并委托处理无法解决的查询,效果优于监督微调,且具有良好的分布外泛化能力。

0 人收藏 0 人点赞
#policy-learning

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers · 2026-05-31 缓存

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。

0 人收藏 0 人点赞
#policy-learning

可操作的世界表示

Hugging Face Daily Papers · 2026-05-18 缓存

WorldString是一种神经架构,能够从点云或RGB-D视频流中建模物体状态流形,作为物理世界模型的基础组件,其可微结构便于与策略学习集成。

0 人收藏 0 人点赞
#policy-learning

基于大语言模型智能体进行分层广义规划时的策略分解学习与复用

arXiv cs.AI · 2026-05-11 缓存

本文介绍了 HCL-GP,这是一种动态策略学习框架,将广义规划与分层任务分解相结合,使基于大语言模型(LLM)的智能体能够学习和复用可执行的策略组件,从而在 AppWorld 基准测试上显著提升性能。

0 人收藏 0 人点赞
#policy-learning

LeRobot v0.5.0:全面扩展

Hugging Face Blog · 2026-03-09 缓存

LeRobot v0.5.0 是一个重大版本,支持 Unitree G1 人形机器人、新的策略架构(Pi0-FAST VLAs、实时分块)、用于提升 3 倍训练速度的流式视频编码,以及用于从 Hugging Face Hub 加载仿真环境的 EnvHub。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈