@wintonARK: 我并不是说这一定会发生或奏效,但在某所高中,某个有抱负且古怪的田径教练将会……
摘要
关于强化学习如何可能保持机器人跑步姿势的讨论,并将其与田径教练在生物力学中的创新策略进行对比。
查看缓存全文
缓存时间: 2026/08/30 22:12
我并不是说这一定会发生或奏效,但在某个高中,总会有个有野心又有个性的田径教练想要尝试。如果真成了,这些视频将成为生物力学领域的“第37手妙招”,被后人铭记。
Rohan Paul (@rohanpaul_ai): 强化学习显然保留了这种跑步姿态与人体姿态的区别。
人类摆臂主要是为了防止每一步时躯干随腿部运动而扭转。而机械臂由电机、齿轮和导线构成,快速摆动会产生……
我并不是说这一定会发生或奏效
但在某个高中,总会有个有野心又有个性的田径教练想要尝试
如果真成了
我们会把这些视频视为生物力学领域的“第37手妙招”
或许吧。不过另一方面,我们学跑步时默认要观察路况,而非单纯追求平地直线速度。(另见:福斯伯里背越式跳高。)
(虽然我个人觉得这招大概率行不通)
相似文章
面向交互式游戏的可教练代理
本文提出一个训练强化学习代理的框架,使其能在实时接受指导的同时,在执行核心任务时采用不同风格,并在《地平线:西之绝境》、《GT赛车》和一个人形行走领域进行了演示。
@mervenoyann:@willcb的有趣演讲
Primordial AI的Will Brown在此次演讲中探讨了如何将强化学习扩展至奖励难以验证的复杂现实任务,涉及锚定法、大语言模型评判与仿真模拟等技术。
@tanayj: https://x.com/tanayj/status/2072766211256119475
本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。
@itsolelehmann: 我认为大多数人不知道,但我非常看好:机器人世界模型。这是如何…
机器人世界模型通过生成模拟视频来实现更快更便宜的训练,例如LTX-2.5,以使机器能够实现高级的物理导航。
警惕下一次大规模预训练
推测性文章:下一次大规模预训练可能在12-14个月内产生超人类AI,进而引发递归式自我改进。