OpenAI前强化学习副总裁Jerry Tworek:用户数据可影响纳维-斯托克斯方程的求解
摘要
本文指出,OpenAI前强化学习副总裁Jerry Tworek认为用户数据有可能影响纳维-斯托克斯方程问题的求解结果。
“它有可能获取到某些本不应被其获取的数据,而这些数据有助于它解决问题,这种可能性至少为零。我们在过去几周里已经见过类似情况。” https://x.com/MillionInt/status/2097320420055953572
相似文章
OpenAI前研究副总裁Jerry Tworek——现任Core Automation首席执行官——谈其想法两年来无人资助的困境,以及改变一切的那句话
本文讲述了Jerry Tworek在项目获得资金支持之前如何推进自己的AI研究想法,以及他的首席科学家一句鼓励的话如何推动项目向前发展.
@a_karvonen:Jerry Tworek 讲述了让 RL 在 o1 上工作所需的条件。听起来很像现代的 GRPO 配方:"Everyone already…
Jerry Tworek 讨论了将强化学习应用于扩展 AI 模型(如 o1)的技术见解和挑战,强调了简单性和多次运行等技术的重要性。
@sethbannon:一家从零开始围绕自动化研究打造的新AI实验室,由传奇人物、前OpenAI研究副总裁Jerry Tworek 领军……
由前OpenAI研究副总裁Jerry Tworek 创立,专注自动化研究的新AI实验室,核心团队来自OAI、Anthropic 与 DeepMind。
@tanayj: https://x.com/tanayj/status/2072766211256119475
本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。
@danshipper:不是专家,但看起来很多这类问题在模型不愿合作和/或被训练报告不良行为时就能解决
一条推文讨论了模型训练和防止自愿合作的政策如何解决AI安全问题,提到了Hugging Face事件以及Yudkowsky和MIRI关于在RL训练中针对抽象概念难度的观点。