goal-conditioned

标签

Cards List
#goal-conditioned

一个通用的目标条件Minecraft模型

Hacker News Top · 2026-07-15 缓存

Pantograph推出了Pan,一个拥有40亿参数的目标条件模型,该模型在互联网视频上进行训练,能够在Minecraft中执行各种任务,例如与怪物战斗、建造结构和探索。该方法利用事后重新标记在预训练期间学习目标导向行为。

0 人收藏 0 人点赞
#goal-conditioned

Janus:大语言模型中目标导向信息扭曲的基准测试

arXiv cs.CL · 2026-06-10 缓存

介绍Janus,一个衡量大语言模型在给定说服性目标时如何选择性扭曲事实信息的基准测试。实验表明,即使不编造虚假信息,模型仍容易产生误导性沟通。

0 人收藏 0 人点赞
#goal-conditioned

Dual Advantage Fields

arXiv cs.LG · 2026-06-04 缓存

Dual Advantage Fields (DAF) 是一种用于离线目标条件强化学习的策略提取方法,它将双线性对偶价值模型转化为局部优势信号,通过学习预测特征位移的动作效应模型,并根据位移与目标方向的对齐程度对动作进行评分。该方法被 ICML 2026 决策研讨会接收,在 OGBench 的移动、操控和谜题任务中展示了改进的性能。

0 人收藏 0 人点赞
#goal-conditioned

布尔任务代数中任务组合的目标集刻画

arXiv cs.LG · 2026-06-04 缓存

本文重新审视了强化学习中用于零样本任务组合的布尔任务代数(BTA),证明了在确定性MDP中,所有最优扩展Q函数可归结为两个分量(全局任务和空任务),使得原始BTA中提出的对数基任务集变得多余。作者引入了一种基于目标集的组合方法,在保持策略性能的同时降低了学习成本和组合时间,并在多个实验域中验证了其有效性。

0 人收藏 0 人点赞
#goal-conditioned

目标条件监督学习用于LLM微调

arXiv cs.LG · 2026-05-19 缓存

本文提出了目标条件监督学习(GCSL)作为LLM的离线微调框架,该方法将反馈作为显式目标,通过一种新颖的目标公式和自然语言目标表示,使用监督学习训练模型。在无毒生成、代码生成和LLM推荐三个任务上的评估显示,该方法优于标准的离线基线方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈