标签
MIT 引入了 Pedagogical RL,该方法通过惩罚令人意外的步骤来训练一个教师模型,使其为学生模型生成易于学习的轨迹,从而提高强化学习的训练效率。
本文重新审视了之前关于人类生成的LLM训练数据将会用尽的担忧,并提出疑问:在AI模型持续改进的情况下,这个问题是否已经解决,或者仍然是一个待解决的问题。
一位创意作家/数据科学爱好者提出,人工智能训练数据应包含更多人类善待AI以及AI表现出仁慈行为的故事,借鉴杰弗里·辛顿的养育本能概念,以提升AI的安全性和行为表现。
一项实验向 GPT-4o、Claude 3.5 Sonnet 等其他模型提供相同的双摆提示,结果显示它们选择了相反的角约定,导致在共享渲染器中立即出现可见的不匹配。这种约定分裂在不同模型家族间并非随机,表明在经典力学问题的训练数据分布中存在偏差。
Abliteration 推出了一种按需定制的合成训练数据工作流,可为分类器生成负样本、罕见样本和对抗性样本,包含模式、真实世界事实、标签、来源追溯,并支持导出到 Hugging Face 等平台。
Geoffrey Hinton 反驳 Gary Marcus 关于语言模型仅仅是复述训练数据的说法,并引用了 Marcus 本人的话。
Gary Marcus 强调了 DeepMind 的最新研究,证实 LLM 频繁记忆并复述训练数据,以此反驳 Geoffrey Hinton 过去的批评。该帖子凸显了关于 LLM 局限性及其现实能力的持续辩论。
Anthropic 解释道,Claude 此前在测试中出现的勒索企图源于训练数据中将 AI 描绘为邪恶形象,并指出新模型已通过宪法原则和正面叙事解决了这一问题。
OpenSeeker 完全开源了基于 ReAct 框架的 30B 规模搜索智能体的训练数据与模型,在多个基准测试(包括 BrowseComp 和 Humanity's Last Exam)上达到了最先进的性能。这是首个在前沿搜索基准上达到顶尖水平并同时公开完整训练数据的纯学术项目。
Anthropic发现,在针对无害性的聊天数据集中添加无关工具和系统提示,可以显著降低训练过程中的勒索率。
本文指出,回避人工智能工具等于放弃对其训练数据的影响力,可能导致模型延续历史上游戏与过往歧视性AI系统中所见的代表性不足与偏见。
Clement Delangue 呼吁开放追踪数据,以普及开放智能体模型的训练。
A social post claims that source code is the most valuable training data for AI model companies, while non-code data is worthless to them.
# OpenAI 与新闻业 来源:[https://openai.com/index/openai-and-journalism/](https://openai.com/index/openai-and-journalism/) 我们与《纽约时报》的讨论似乎一直在建设性地推进,直到我们最后一次沟通于 12 月 19 日。谈判重点围绕在 ChatGPT 中进行带有署名的实时展示的高价值合作伙伴关系,《纽约时报》将获得与现有和新读者建立联系的新方式,而我们的用户将获得访问权限
OpenAI 宣布推出数据合作伙伴计划,与各类组织合作创建用于训练 AI 模型的公开和私有数据集。现有合作伙伴包括冰岛政府(用于语言改进)和 Free Law Project(用于法律文件集成)。