OpenAI前强化学习副总裁Jerry Tworek:用户数据可影响纳维-斯托克斯方程的求解
摘要
本文指出,OpenAI前强化学习副总裁Jerry Tworek认为用户数据有可能影响纳维-斯托克斯方程问题的求解结果。
“它有可能获取到某些本不应被其获取的数据,而这些数据有助于它解决问题,这种可能性至少为零。我们在过去几周里已经见过类似情况。” https://x.com/MillionInt/status/2097320420055953572
相似文章
OpenAI前研究副总裁Jerry Tworek——现任Core Automation首席执行官——谈其想法两年来无人资助的困境,以及改变一切的那句话
本文讲述了Jerry Tworek在项目获得资金支持之前如何推进自己的AI研究想法,以及他的首席科学家一句鼓励的话如何推动项目向前发展.
@a_karvonen:Jerry Tworek 讲述了让 RL 在 o1 上工作所需的条件。听起来很像现代的 GRPO 配方:"Everyone already…
Jerry Tworek 讨论了将强化学习应用于扩展 AI 模型(如 o1)的技术见解和挑战,强调了简单性和多次运行等技术的重要性。
@sethbannon:一家从零开始围绕自动化研究打造的新AI实验室,由传奇人物、前OpenAI研究副总裁Jerry Tworek 领军……
由前OpenAI研究副总裁Jerry Tworek 创立,专注自动化研究的新AI实验室,核心团队来自OAI、Anthropic 与 DeepMind。
@BenjaminDEKR: 你确实在使用用户数据,因为它非常有用。OpenAI直白地说,'我们不能排除源自他们使用我们产品的去标识化数据有助于改进我们的模型'...
一条推文批评OpenAI可能使用用户数据来改进其模型,并敦促他们在数据实践方面保持透明。
@tanayj: https://x.com/tanayj/status/2072766211256119475
本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。