human-feedback

标签

Cards List
#human-feedback

FLOORA:一个与人类对齐、面向建筑设计的领域专用语言模型

arXiv cs.LG ↗ · 7小时前 缓存

Autodesk Research 推出了 FLOORA——一系列用于建筑布局生成的小型领域专用语言模型,其核心是使用一种自定义的领域特定语言(DSL)。其中 0.6B 参数的模型在面对分布外的建筑案例时,表现优于体量大得多的前沿模型,VLM 评审胜率最高可达 92%。

0 人收藏 0 人点赞
#human-feedback

异质偏好学习

arXiv cs.AI ↗ · 2026-09-17 缓存

本文提出了一种从多模态数据中学习个体化效用函数的多阶段架构,表明在美学判断等主观任务中,考虑异质偏好的模型优于通用效用模型。

0 人收藏 0 人点赞
#human-feedback

@dotey: Claude 新的一篇博文《How Warp builds self-improving agents on Claude》 https://claude.com/blog/how-warp-builds-self-improving-a…

X AI KOLs Timeline ↗ · 2026-08-29 缓存

本文介绍了Warp如何利用Claude构建自改进的AI代理,通过人类反馈自动优化技能,并总结了有效代理开发的最佳实践。

0 人收藏 0 人点赞
#human-feedback

算法影响揭示了对齐的隐藏社会选择结构

arXiv cs.AI ↗ · 2026-08-26 缓存

本文将AI对齐重新表述为一个社会选择问题,通过凸影响空间上的线性优化,结合福利经济学和机制设计来推导对齐协议。并在肾脏分配、慈善食品分发、LLM回应和电车问题等场景中使用真实人类偏好实证阐述了其福利含义。

0 人收藏 0 人点赞
#human-feedback

@swyx:我认为很容易说“模拟是新的扩展规律”,并将其视为营销炒作,但在采访中途……

X AI KOLs Timeline ↗ · 2026-08-21 缓存

该推文讨论了模拟作为AI中潜在的新扩展规律,强调了来自Simile AI首席执行官的采访洞见,关于模拟人类行为以进行高级AI研究。

0 人收藏 0 人点赞
#human-feedback

@Vtrivedy10:基于人类反馈的合成环境生成——智能体作为一次性评估/环境生成器表现不佳,因为它们……

X AI KOLs Following ↗ · 2026-08-04 缓存

一条推文,介绍来自 langchain-ai/langchain-skills 的 eval-engineering 技能,该技能利用人类反馈为智能体评估生成对齐的环境、测试框架(harness)和任务。它解释了工作流程,并提供了该开源工具的安装说明。

0 人收藏 0 人点赞
#human-feedback

DesignArena 创造者筹集 790 万美元,为 AI 模型带来审美

TechCrunch AI ↗ · 2026-08-03 缓存

AI 评估工具 DesignArena 背后的公司 Intelligence 完成了 790 万美元的种子轮融资,由 Index Ventures 领投。该平台利用人类偏好排名来改进 AI 生成的媒体内容,目前拥有 530 万用户和 6000 万美元的年度经常性收入(ARR)。

0 人收藏 0 人点赞
#human-feedback

LEMUR:从偏好反馈中学习与多目标强化学习对齐

arXiv cs.AI ↗ · 2026-08-03 缓存

本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。

0 人收藏 0 人点赞
#human-feedback

将"人类拒绝"视为与"智能体故障"不同的故障模式——事实证明,这种区分在生产环境中非常重要

Reddit r/AI_Agents ↗ · 2026-07-27

讨论如何将'人类拒绝'视为与'智能体故障'不同的故障模式,这显著影响了AI智能体在生产环境中的可靠性和调试。

0 人收藏 0 人点赞
#human-feedback

通过世界模型从人类偏好和理由中学习安全智能体行为

arXiv cs.AI ↗ · 2026-07-16 缓存

本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。

0 人收藏 0 人点赞
#human-feedback

@maxrumpf: 人类是低上限

X AI KOLs Timeline ↗ · 2026-07-07 缓存

Max Rumpf 认为,在训练先进AI模型时,人类反馈正变得过时,他引用了国际象棋、数学和搜索等例子。他主张使用自我对弈和合成数据等无需人类的方法,而Will Depue的一条引用推文则呼吁建立与计算规模相平行的大规模数据基础设施。

0 人收藏 0 人点赞
#human-feedback

为AI智能体构建反馈记忆层,从每次人类批准与拒绝中学习

Reddit r/AI_Agents ↗ · 2026-06-24

本文提出了一种面向AI智能体的反馈记忆层,该层从每次人类的批准或拒绝中学习,从而通过与用户的交互实现持续改进。

0 人收藏 0 人点赞
#human-feedback

隐藏的共识:人类反馈中的偏好有效性压缩

arXiv cs.CL ↗ · 2026-06-10 缓存

本文认为,标准RLHF将人类偏好标量化的做法导致多个有效解释被压缩为单一目标,从而在文化多元的社会中错误衡量对齐。通过对马来西亚数据集的分析,研究发现79%的提示词存在多个多数支持的回答,而这些回答在单一胜者聚合中被丢弃。

0 人收藏 0 人点赞
#human-feedback

人们到底想从AI得到什么?映射偏好多元性

arXiv cs.CL ↗ · 2026-06-08 缓存

本文分析了来自75个国家的1500份开放式回答,揭示了人们对AI的偏好多样且常常相互冲突,其中真实是唯一被广泛需求的价值(49%),但定义方式却互不兼容。研究认为,当前的RLHF方法将这些多元偏好扁平化为通用奖励模型,延续了认知暴力。

0 人收藏 0 人点赞
#human-feedback

StepAudio 2.5 技术报告

Hugging Face Daily Papers ↗ · 2026-05-22 缓存

StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。

0 人收藏 0 人点赞
#human-feedback

@oshaikh13:超酷的点子 @OpenAI,我对这次研究预览超兴奋——从人类与电脑的“非聊天”交互中学习,将解锁一大堆超酷的互动方式(我们还为此发了篇论文!!https://arxiv.org/abs/2505.10831)

X AI KOLs Following ↗ · 2026-04-20

OpenAI 发布研究预览,探索如何超越聊天界面,从人类与电脑的交互中学习,并同步上线相关 arxiv 论文。

0 人收藏 0 人点赞
#human-feedback

WildFeedback: 通过原位用户交互和反馈对齐大语言模型

arXiv cs.CL ↗ · 2026-04-20 缓存

WildFeedback是一个新颖的框架,它利用真实LLM对话中的原位用户反馈来自动创建偏好数据集,用于将语言模型与人类偏好对齐,解决了传统基于标注的对齐方法中的可扩展性和偏差问题。

0 人收藏 0 人点赞
#human-feedback

AI编写的评论帮助人类发现缺陷

OpenAI Blog ↗ · 2022-06-13 缓存

# AI编写的评论帮助人类发现缺陷 来源:[https://openai.com/index/critiques/](https://openai.com/index/critiques/) 我们希望确保未来执行极困难任务的AI系统始终与人类意图保持一致。[Many⁠](https://openai.com/index/learning-to-summarize-with-human-feedback/)[previous⁠\(opens in a new window\)](https://arxiv.org/abs/2204.05862)[works⁠\(opens in a new window\)](https://www.deepmind.com/publications/gophercite-teaching-language-models-to-suppo

0 人收藏 0 人点赞
#human-feedback

利用人工反馈进行图书摘要总结

OpenAI Blog ↗ · 2021-09-23 缓存

OpenAI 展示了一种可扩展的对齐技术,使用人工反馈进行整本书的分层摘要总结,展示了如何训练模型在复杂、难以评估的任务上按照人类意图行动。

0 人收藏 0 人点赞
#human-feedback

通过人类反馈学习总结

OpenAI Blog ↗ · 2020-09-04 缓存

OpenAI展示了一种通过在人类偏好上训练奖励模型并使用强化学习微调模型来改进语言模型总结的技术,实现了在数据集间具有良好泛化性能的显著质量提升。这项工作通过大规模人类反馈推进了模型对齐,并具有超越总结任务的应用前景。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈