标签
本文提出了用于个性化设备端行程生成的计划-学习-适应(PLA)框架,该框架将保证可行性的组合规划与通过 Bradley-Terry 奖励模型进行的人类偏好学习相结合。在实际部署中,该框架实现了行程完成率提升 91%,且延迟低,在可行性方面超过了前沿大语言模型。
PerceptionRubrics 引入了一种基于评分准则的多模态评估框架,通过原子审计和门控评分,使基准分数更好地与人类感知对齐,揭示了可靠性差距和开闭分层。
本文介绍CLIPR,一个从最少的对话输入中学习可转移的潜在用户偏好的框架,以改进LLM中与人类一致的决策。