@Dorialexander: 因为我一直关注RL环境市场:Anthropic确实做了大量的Slack强化学习
摘要
一条推文强调,Anthropic利用Slack对话进行了大规模的强化学习,Andrej Karpathy强调这并非像通常被误解的那样是一个简单的Slack机器人功能。
查看缓存全文
缓存时间: 2026/06/25 00:08
既然我一直关注RL环境市场:Anthropic确实在Slack上做了大量强化学习
安德烈·卡帕西(@karpathy): 没错,我觉得团队里很多人根本没仔细看标题以外的内容,就做出了完全错误的推断和比较,还借机妄加非议。这可不是什么蹩脚Slack机器人的“功能”,更不是Claw。
相似文章
@RLanceMartin: https://x.com/RLanceMartin/status/2070571422913876182
这篇文章讨论了Anthropic的Claude Tag从单用户代理演变为Slack中的组织级工具的过程,通过改进的模型能力和安全性,实现了多玩家协作、异步工作和主动行为。
@_djdumpling:非常令人兴奋的工作,很高兴今年夏天能在 @modal 从事强化学习工作!
用户对在 Modal 从事强化学习工作表示兴奋,并提及 Modal 发布了开源库以及在扩展强化学习训练中学到的经验。
@tanayj: https://x.com/tanayj/status/2072766211256119475
本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。
@didier_lopes: 难以置信,Z. ai 竟然将其强化学习基础设施开源了。GLM-5.2 的整个 OPD 后训练只用了…
Z. ai 将其强化学习基础设施 slime 框架开源,该框架使 GLM-5.2 的 OPD 后训练在约两天内高效完成。slime 是一个用于强化学习扩展的 LLM 后训练框架,集成了 Megatron 和 SGLang,并已通过 GLM、Qwen、DeepSeek 和 Llama 等前沿模型的实战测试。
@adithya_s_k: https://x.com/adithya_s_k/status/2054961319179420035
分析为什么强化学习在编程任务中因可验证奖励而受到青睐,以及新兴框架Harbor如何解决RL训练中环境复杂度的瓶颈。