标签
本文介绍了OpenThoughts-Agent,一个开源的用于训练智能体语言模型的数据整理流程,在七项基准测试中取得了44.8%的平均准确率,并通过系统性实验超越了先前的开源数据集。
本文深入分析了AI的样本效率远低于人类的问题,指出前沿模型需要海量领域特定数据,而人类仅需少量示例即可学习,这种数据黑洞是当前AI发展的核心瓶颈。文章通过多个比较(标记量、机器人操控、驾驶)和反驳常见反对意见,论证了这一差距的严峻性,并探讨了对AI自动化目标的影响。
一篇评论文章认为,AI模型从训练数据中获取危险知识,而像Anthropic和OpenAI这样的公司依赖容易破解的拒绝过滤器,而非真正移除有害能力,优先考虑速度而非安全。
《大西洋月刊》创建了一个包含数百万首用于训练AI模型的音乐曲目的可搜索数据库,允许公众搜索四个数据集,包括来自Google和Stability AI的数据集。
文章质疑为何OpenAI和Anthropic等前沿AI实验室不公开其训练数据规模,暗示模型性能提升可能源于数据量而非真正的智能。
一项名为Trace Commons的新倡议旨在将编码智能体的追踪记录收集到开放CC-BY-4.0数据集中,以帮助训练开放权重和开源模型,从而对抗来自Anthropic和OpenAI的专有模型的数据优势。
DeMix 是一个新颖的框架,通过分析影响向量来检测错误训练样本并识别其具体错误类型(标签错误、特征错误、虚假关联),在数据修复后实现了调试F1分数提升22.61%和任务性能提升9.32%。
本文介绍了一种名为ISE的三阶段合成范式,用于生成带有基于执行的多轮操作系统代理轨迹,并证明在生成的ISE-Trace数据集上进行微调能显著提升代理在ClawEval上的性能。
这篇入门论文探讨了推理模型在训练后如何改进,认为有效的推理数据更多地依赖于可检查的训练证据而非原始数据量。它根据验证方法对推理数据进行分类,并强调保留混乱的智能体数据以获取学习信号。
本文介绍了LIMMT,这是一项以数据为中心的研究,表明使用高质量、极小的运动数据子集(不到AMASS的3%)进行训练,在基于物理的人形动作追踪方面优于使用完整数据集,并通过物理可行性、多样性和复杂性来定义运动数据质量。
Anyscale展示了通过使用Alluxio NVMe缓存和Ray Data,跨区域训练数据读取速度提升了20倍,显示1TB数据的缓存预热读取时间从4,241秒降至208秒。
本文探讨模型崩塌不是技术缺陷,而是认识论问题:当AI模型的输出成为自身输入时,模型对现实的表征逐渐扁平化为一种自我指涉的平均值,这引发了我们如何区分一个建模世界的模型与一个只建模自身的模型的问题。
Asuka Zheng认为,关于'训练数据即将耗尽'的恐慌是错位的;真正的稀缺在于收集多样化、长周期数据时的想象力不足,她用自己的SRE替代项目及更广泛的研究趋势说明了这一点。
本文识别了在LLM SFT的答案正确的长思维链训练轨迹中的有害延续,其特征为不确定性-几何不匹配,并提出了一种轻量级边界代理方法来去除它们。
本文诊断了LLM生成故事的低多样性问题,发现88.3%的采样故事包含11个常见词汇之一(例如埃利亚斯、灯塔),且这些词汇在不同模型间普遍存在,并将这种同质性归因于后训练数据和对齐,而非预训练数据中的普遍存在。
本文研究了密集检索器中位置偏差的来源是架构还是训练数据,发现训练数据分布强烈影响偏差,而均衡训练可将敏感性降低高达87%,同时保持检索性能。
这篇文章讨论了一个担忧:随着AI工具生成越来越多的代码,未来基于这些合成代码训练的模型可能会质量下降、原创性降低,并询问像OpenAI、Anthropic和GitHub这样的主要AI实验室计划如何应对这个问题。
本文利用fMRI数据和多种LLM,研究了英语、中文和法语中的大脑-LLM对齐,发现训练语言主导性和类型距离(而非英语固有的优势)驱动了对齐模式。