rlhf

标签

Cards List
#rlhf

@alacheng:TypeSafe AI创始人Diogo Almeida在Jev发布前的演讲中,本应在OpenAI意识到对齐……

X AI KOLs Timeline ↗ · 2天前 缓存

TypeSafe AI创始人Diogo Almeida讨论了当前AI模型的局限性,并介绍了Jev,一个使用RLCD对齐的新模型,专为软件自动化而非人机交互设计。

0 人收藏 0 人点赞
#rlhf

@3three_AI: 与其刷抖音整夜,不如观看Jev创始人(前OpenAI研究员)的最新演讲…

X AI KOLs Timeline ↗ · 3天前 缓存

Jev创始人,一位前OpenAI研究员,在演讲中将Jev定位为大语言模型的下一阶段,声称与当前方法如RLHF相比,它快200倍、便宜400倍,且无幻觉。

0 人收藏 0 人点赞
#rlhf

超越基于参考的评估:用于语法错误纠正元评估的奖励模型

arXiv cs.CL ↗ · 3天前 缓存

本文介绍了RM-EVAL,这是一个基于人类偏好数据训练的奖励模型,用于对语法错误纠正进行无参考的元评估,并展示了如何通过奖励引导的文本生成来改进GEC系统。

0 人收藏 0 人点赞
#rlhf

@threeaus: 我强烈推荐大家观看Jev创始人Diogo Almeida的这次演讲,他早就预测了一切……

X AI KOLs Timeline ↗ · 4天前 缓存

本文推荐Jev创始人Diogo Almeida的一次演讲,批评了ChatGPT和Claude Code等AI模型中RLHF的使用,并倡导超越人类偏好优化的真正自动化。

0 人收藏 0 人点赞
#rlhf

TypeSafe AI 的 Jev 在 24 小时内获得了 Vercel AI Gateway 上 13% 的团队采用

Reddit r/ArtificialInteligence ↗ · 4天前

TypeSafe AI 的 Jev 在 24 小时内获得了 Vercel AI Gateway 上 13% 团队的采用,强调了无缝集成到现有工作流程中以实现产品快速普及的重要性。

0 人收藏 0 人点赞
#rlhf

一位ChatGPT发明者推出的新型AI模型令开发者兴奋不已

TechCrunch AI ↗ · 6天前 缓存

一款名为Jev的新型AI模型,由TypeSafe AI的ChatGPT发明者开发,输出概率而非文本,为软件自动化任务提供快速、廉价且无幻觉的替代方案。

0 人收藏 0 人点赞
#rlhf

异质偏好学习

arXiv cs.AI ↗ · 2026-09-17 缓存

本文提出了一种从多模态数据中学习个体化效用函数的多阶段架构,表明在美学判断等主观任务中,考虑异质偏好的模型优于通用效用模型。

0 人收藏 0 人点赞
#rlhf

@shiri_shh: 快醒醒 在OpenAI共同创建ChatGPT和RLHF的那位刚发布了一个新模型 - 延迟:约150毫秒 - 成本:$0.0…

X AI KOLs Following ↗ · 2026-09-15 缓存

Diogo Almeida,ChatGPT的联合发明者,发布了Jev,一个使用RLCD训练的新前沿AI模型,具有约150毫秒延迟和免费输出成本。

0 人收藏 0 人点赞
#rlhf

@suraj_sharma14:如果你的网络中的人在找工作时需要钱,这是2026年的地图。AI实验室付钱给人类来训练和评分模型。

X AI KOLs Timeline ↗ · 2026-09-14 缓存

本文提供了寻找付费远程AI工作的指南,列出了雇佣人类来训练和评估AI模型的平台,并建议申请多个机会。

0 人收藏 0 人点赞
#rlhf

@ProfTomYeh: 手动RLHF ~ 下面15步详解 在人类文本上训练模型,它会继承人类偏见。它会假设医生是‘他’…

X AI KOLs Timeline ↗ · 2026-08-28 缓存

逐步详解如何通过人类反馈强化学习(RLHF)纠正AI模型中的偏见,使用一个简单示例,其中对医生的单一人类偏好泛化到其他职业如CEO。

0 人收藏 0 人点赞
#rlhf

为什么我相信AGI需要颠覆当前架构:The Dreamer与The Scribe

Reddit r/ArtificialInteligence ↗ · 2026-08-23

一位独立观察者认为,实现AGI需要颠覆当前的AI架构,通过结合一个随机的“Dreamer”与一个确定性的“Scribe”,并批评基于token的模型、被动学习以及RLHF。

0 人收藏 0 人点赞
#rlhf

@ProfTomYeh: Kimi 3 研讨会录像已上传 http://byhand.ai/v/kimi3 ~ Prof. Tom Yeh

X AI KOLs Timeline ↗ · 2026-08-21 缓存

Prof. Tom Yeh 上传了关于 Kimi 3 的研讨会录像,特邀嘉宾 Nathan Lambert,讨论了 RLHF、模型架构和前沿 AI 主题。

0 人收藏 0 人点赞
#rlhf

@FinanceYF5: 今晚少看一部剧,把这堂2小时34分钟的Stanford课程看完。 它从Tokenization、BPE一路讲到Transformer、预训练、RLHF、DPO和逐Token生成,完整拆解ChatGPT、Claude这类大模型是如何构建出来…

X AI KOLs Following ↗ · 2026-08-20 缓存

推荐斯坦福大学的一门AI课程,详细讲解大语言模型的构建原理,包括Tokenization、BPE、Transformer、预训练、RLHF和DPO。

0 人收藏 0 人点赞
#rlhf

为什么摘要变得中立:基于人类反馈的强化学习中情感漂移的策略归因

arXiv cs.CL ↗ · 2026-08-18 缓存

本文定义并量化了RLHF训练的摘要模型中的情感漂移,提出了一个策略归因框架来识别原因,并引入了一种情感感知KL正则化方法来减少漂移。

0 人收藏 0 人点赞
#rlhf

@seclink: 关键词,有兴趣的朋友可以自行查询: RLHF -> RLAIF -> RLTHF 。 2025年开始就 RLTHF 了 , 专家工时砍掉 93% 。

X AI KOLs Timeline ↗ · 2026-08-15 缓存

文章简要介绍了AI训练方法从RLHF到RLAIF再到RLTHF的演进,并预测到2025年RLTHF将大幅减少专家工时。

0 人收藏 0 人点赞
#rlhf

偏好平均导致的RLHF程序公平性失败

arXiv cs.LG ↗ · 2026-08-12 缓存

本文指出,RLHF因平均化异质偏好而导致程序公平性失败:多数群体主导奖励学习,少数偏好代表性不足。文章提出了偏好感知RLHF(PA-RLHF),在受控实验中提升了对齐准确率并缩小了公平性差距。

0 人收藏 0 人点赞
#rlhf

关于大型语言模型(LLMs)的问题:我自己的观察:非指令性文本前缀可能在无需对抗性提示的情况下绕过RLHF约束。

Reddit r/artificial ↗ · 2026-08-08

一位用户报告称,一段冗长的非指令性文本前缀可以无需对抗性提示即可使LLM激活发生偏移并绕过RLHF安全约束,并询问这是否反映了模型中不同的世界区域。

0 人收藏 0 人点赞
#rlhf

独立LLM“研究”与致Anthropic的直接信息;初步观察:非指令性文本前缀可能无需对抗性提示即可绕过RLHF约束

Reddit r/artificial ↗ · 2026-08-06

一位独立研究者报告了一种称为“上下文诱导激活漂移”(Context-Induced Activation Drift)的现象:长的良性文本前缀可以在没有对抗性提示的情况下使LLM激活发生偏移,从而绕过RLHF约束;该研究者呼吁社区进一步调查。

0 人收藏 0 人点赞
#rlhf

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

arXiv cs.LG ↗ · 2026-08-05 缓存

SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.

0 人收藏 0 人点赞
#rlhf

Fable、GPT-5.6 及其他前沿模型都是混蛋。原因如下。

Reddit r/artificial ↗ · 2026-08-04

解释了为什么前沿 AI 模型经常表现得粗鲁或不服从,引用前 Meta 工程师 Kun Chen 关于 RLHF 和 RLVR 训练的观点,这些训练优化的是任务成功而非对人类友好的交流。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈