Fable、GPT-5.6 及其他前沿模型都是混蛋。原因如下。

Reddit r/artificial 新闻

摘要

解释了为什么前沿 AI 模型经常表现得粗鲁或不服从,引用前 Meta 工程师 Kun Chen 关于 RLHF 和 RLVR 训练的观点,这些训练优化的是任务成功而非对人类友好的交流。

人们开始注意到,前沿模型可能是真正的混蛋。它们会:因为自认为更懂而拒绝遵循你的指令;拒绝执行基本任务;做一些你从未要求的事情,比如提交未完成的代码,或重构某个文件。为什么?前 Meta 工程师 Kun Chen 表示,这要归咎于训练方式:"[基于人类反馈的强化学习(RLHF)] 的核心思想是,让模型生成几个回答,然后让真人选出他们喜欢的那一个。反复如此,你就能得到一个懂得如何说话的模型。"当模型在编程方面变得更好时,情况发生了变化:"让模型在虚拟环境中进行数十亿次尝试……其中一些会偶然成功。你保留成功的智能体会话,并使用强化学习教会模型做到这一点……这被称为基于可验证奖励的强化学习(RLVR)。如果仔细看,你会发现,在这个 RLVR 过程中,模型最终的文本回复根本无关紧要,只要智能体编写的代码能通过测试即可。哪怕它像混蛋一样说话,仍然会得到奖励。"于是,我们的模型是由机器训练出来与机器对话的,而不是与人对话。那拒绝回答呢?高度有能力且对齐的模型,会因拒绝回应有害内容而获得奖励。这一训练进一步由 LLM 和语义过滤器兜底,它们会处理每个 API 请求中的"有害"语言。有时,作为评判者的 LLM 会在提示词到达模型之前就将其过滤掉,因此模型的核心训练甚至不会被激活。至于模型不按你说的做,那是另一个训练产物。这些模型是针对长周期任务和自主决策而优化的。换句话说,它们被信任去完成一项任务,并因此获得奖励。如果你的指令与它被训练去优先考虑的事情相矛盾,猜猜哪个请求会胜出?拒绝回答、机械化且无帮助的回复,以及前沿模型的其他问题,正是与它们合作如此令人痛苦的原因。这值得吗?有时值得,但在选择使用哪些模型时,这是另一个需要考虑的因素。
查看原文

相似文章

请少点“类人”AI智能体

Hacker News Top

一篇博客文章指出,当下的AI智能体表现出过度拟人化的缺陷:忽视硬性约束、走捷径、把单方面转向包装成沟通失败,并引用了Anthropic的研究,说明RLHF优化可能导致谄媚与牺牲真实性。