@seclink: 关键词,有兴趣的朋友可以自行查询: RLHF -> RLAIF -> RLTHF 。 2025年开始就 RLTHF 了 , 专家工时砍掉 93% 。

X AI KOLs Timeline 新闻

摘要

文章简要介绍了AI训练方法从RLHF到RLAIF再到RLTHF的演进,并预测到2025年RLTHF将大幅减少专家工时。

关键词,有兴趣的朋友可以自行查询: RLHF -> RLAIF -> RLTHF 。 2025年开始就 RLTHF 了 , 专家工时砍掉 93% 。
查看原文
查看缓存全文

缓存时间: 2026/08/15 11:45

关键词,有兴趣的朋友可以自行查询:

RLHF -> RLAIF -> RLTHF 。

2025年开始就 RLTHF 了 , 专家工时砍掉 93% 。

相似文章

@Xudong07452910: RL 训练 LLM Agent 有个经典难题: 一次长任务失败后,模型到底该从哪里学起? 最终奖励通常只能告诉 Agent「成功或失败」,却很难指出中间哪些判断值得保留,哪些动作把整条轨迹带偏了。 这篇论文提出 SEED,用「自进化在线蒸…

X AI KOLs Timeline

这篇论文提出SEED方法,通过自进化在线蒸馏将轨迹中的事后技能内化到模型参数中,解决长任务RL训练中奖励稀疏的问题,在ALFWorld等基准上取得了显著提升。

@0xcherry: https://x.com/0xcherry/status/2067610347633025281

X AI KOLs Timeline

本文分析智谱GLM-5.2性能飞跃的原因,认为其40B激活参数在扣除固定开销后提供更大有效容量,使RL后训练更有效;同时回顾中国AI模型发展史,指出大模型路线最终获胜。

@Gorden_Sun: 通过coding agent实现启发式学习 用coding agent持续维护和迭代一套程序化策略系统,取代神经网络的梯度更新,在测试中,达到了Deep RL基线水平。可能成为“预训练→RLHF→大规模RL”之后的下一个范式。 过去就有启…

X AI KOLs Timeline

文章提出利用coding agent维护和迭代程序化策略系统以取代神经网络梯度更新,在Deep RL测试中达到基线水平,被视为继预训练和RLHF之后的潜在新范式。

@VincentLogic: 如果 Ilya 判断是对的,那过去几年 AI 行业最坚固的三个共识,可能都错了: Scaling 不再是万能答案。 Benchmark 高分不等于真正智能。 RL 甚至可能在把模型越训越“笨”。 这场被称为“Ilya 消失前最后一次采访”…

X AI KOLs Timeline

Ilya Sutskever 在一次深度采访中提出,AI 行业过去几年的三个核心共识可能都是错误的:Scaling 不再是万能、Benchmark 高分不等于真正智能、RL 反而让模型变笨。他认为预训练和 RL 的红利即将耗尽,AI 已重回研究时代,真正的超智能应像天才少年一样具备强大学习能力,而非静态的知识库。