@threeaus: 我强烈推荐大家观看Jev创始人Diogo Almeida的这次演讲,他早就预测了一切……

X AI KOLs Timeline 新闻

摘要

本文推荐Jev创始人Diogo Almeida的一次演讲,批评了ChatGPT和Claude Code等AI模型中RLHF的使用,并倡导超越人类偏好优化的真正自动化。

我强烈推荐大家观看Jev创始人Diogo Almeida的这次演讲,他早就预测了关于Jev的一切。 Jev从一开始就以自动化为目标。Diogo Almeida认为,当前的大型语言模型走上了一个真正的史诗级弯路,那就是RLHF。 RLHF在人机交互方面表现出色,即取悦人类,但在自动化方面却很糟糕。它无法实现完全自动化;人类必须参与其中。 不仅是ChatGPT,Claude Code的原罪也在于RLHF。因此他认为,ChatGPT和Claude Code本质上属于同一范式——Claude Code不是下一个时代;真正的自动化才是下一个时代。 简单来说,RLHF是关于收集人类偏好并基于它们进行优化。其优化目标也不是自动化。 他还否定了RLVR作为解决方案:RLHF优化人类偏好,RLVR优化纯粹正确性,而他们追求的第三条路径优化的是校准的决策能力。 Diogo Almeida认为,数据比计算更重要,做正确的任务远比数据重要。预训练模型本身已经足够聪明;问题只是我们用偏好优化歪曲了它们。 附注:视频翻译使用了@dotey的BaoCut,这基本上是我梦想中的翻译软件——它非常有用。 原始视频链接:
查看原文
查看缓存全文

缓存时间: 2026/09/21 23:39

强烈建议大家观看 Jev 创始人 Diogo Almeida 的这场演讲,他早已预言了关于 Jev 的一切。

Jev 从一开始就是为自动化而生的。Diogo Almeida 认为,当前的大语言模型走上了一条堪称史诗级的弯路——那就是 RLHF(基于人类反馈的强化学习)。

RLHF 在人机交互(即取悦人类)方面表现出色,但在自动化方面却糟糕透顶。它无法实现完全自动化;人类必须始终参与其中。

不仅是 ChatGPT,Claude Code 的原罪也在于 RLHF。因此他认为,ChatGPT 和 Claude Code 本质上属于同一范式——Claude Code 并非下一个时代;真正的自动化才是未来。

简而言之,RLHF 是关于收集人类偏好并基于此进行优化。它的优化目标也不是自动化。

他还否定了 RLVR 是答案的观点:RLHF 优化人类偏好,RLVR 优化纯粹的正确性,而他们正在探索的第三条路径优化的是校准后的决策能力。

Diogo Almeida 相信数据比算力更重要,而做对任务远比拥有数据更重要。预训练模型本身已经足够聪明;问题只在于我们用偏好优化扭曲了它们。

附:视频翻译使用了 @dotey 的宝剪制作,这基本就是我梦想中的翻译软件——超好用。

原始视频链接:

相似文章