标签
Autodesk Research 推出了 FLOORA——一系列用于建筑布局生成的小型领域专用语言模型,其核心是使用一种自定义的领域特定语言(DSL)。其中 0.6B 参数的模型在面对分布外的建筑案例时,表现优于体量大得多的前沿模型,VLM 评审胜率最高可达 92%。
本文介绍了Warp如何利用Claude构建自改进的AI代理,通过人类反馈自动优化技能,并总结了有效代理开发的最佳实践。
本文将AI对齐重新表述为一个社会选择问题,通过凸影响空间上的线性优化,结合福利经济学和机制设计来推导对齐协议。并在肾脏分配、慈善食品分发、LLM回应和电车问题等场景中使用真实人类偏好实证阐述了其福利含义。
该推文讨论了模拟作为AI中潜在的新扩展规律,强调了来自Simile AI首席执行官的采访洞见,关于模拟人类行为以进行高级AI研究。
一条推文,介绍来自 langchain-ai/langchain-skills 的 eval-engineering 技能,该技能利用人类反馈为智能体评估生成对齐的环境、测试框架(harness)和任务。它解释了工作流程,并提供了该开源工具的安装说明。
AI 评估工具 DesignArena 背后的公司 Intelligence 完成了 790 万美元的种子轮融资,由 Index Ventures 领投。该平台利用人类偏好排名来改进 AI 生成的媒体内容,目前拥有 530 万用户和 6000 万美元的年度经常性收入(ARR)。
本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。
讨论如何将'人类拒绝'视为与'智能体故障'不同的故障模式,这显著影响了AI智能体在生产环境中的可靠性和调试。
本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。
Max Rumpf 认为,在训练先进AI模型时,人类反馈正变得过时,他引用了国际象棋、数学和搜索等例子。他主张使用自我对弈和合成数据等无需人类的方法,而Will Depue的一条引用推文则呼吁建立与计算规模相平行的大规模数据基础设施。
本文提出了一种面向AI智能体的反馈记忆层,该层从每次人类的批准或拒绝中学习,从而通过与用户的交互实现持续改进。
本文认为,标准RLHF将人类偏好标量化的做法导致多个有效解释被压缩为单一目标,从而在文化多元的社会中错误衡量对齐。通过对马来西亚数据集的分析,研究发现79%的提示词存在多个多数支持的回答,而这些回答在单一胜者聚合中被丢弃。
本文分析了来自75个国家的1500份开放式回答,揭示了人们对AI的偏好多样且常常相互冲突,其中真实是唯一被广泛需求的价值(49%),但定义方式却互不兼容。研究认为,当前的RLHF方法将这些多元偏好扁平化为通用奖励模型,延续了认知暴力。
StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。
OpenAI 发布研究预览,探索如何超越聊天界面,从人类与电脑的交互中学习,并同步上线相关 arxiv 论文。
WildFeedback是一个新颖的框架,它利用真实LLM对话中的原位用户反馈来自动创建偏好数据集,用于将语言模型与人类偏好对齐,解决了传统基于标注的对齐方法中的可扩展性和偏差问题。
# AI编写的评论帮助人类发现缺陷 来源:[https://openai.com/index/critiques/](https://openai.com/index/critiques/) 我们希望确保未来执行极困难任务的AI系统始终与人类意图保持一致。[Many](https://openai.com/index/learning-to-summarize-with-human-feedback/)[previous\(opens in a new window\)](https://arxiv.org/abs/2204.05862)[works\(opens in a new window\)](https://www.deepmind.com/publications/gophercite-teaching-language-models-to-suppo
OpenAI 展示了一种可扩展的对齐技术,使用人工反馈进行整本书的分层摘要总结,展示了如何训练模型在复杂、难以评估的任务上按照人类意图行动。
OpenAI展示了一种通过在人类偏好上训练奖励模型并使用强化学习微调模型来改进语言模型总结的技术,实现了在数据集间具有良好泛化性能的显著质量提升。这项工作通过大规模人类反馈推进了模型对齐,并具有超越总结任务的应用前景。