标签
本文将语言模型视为语言产物,使用意大利模型来探究其训练过程,并质疑其对语言的表征。文章主张在自然语言处理中区分技术产品和研究工具。
本文通过比较生成输出与训练数据的熵来研究大型语言模型中的条件多样性差距,并提出一个信息论框架来度量和缓解这一差距。
一个人使用Qwen3.8-27B Q4模型构建了Minecraft克隆,并添加了自定义功能,以应对批评称Minecraft数据影响了训练。
文章对OpenAI和Anthropic等主要AI提供商进行审计,发现他们默认在消费级计划中使用用户聊天数据进行训练,而退出选项往往隐藏在设置中。
据报道,Google正在与AI编程初创公司Mechanize进行高级谈判,拟达成15亿美元的交易。Mechanize开发虚拟环境、基准测试和训练数据,以帮助AI代理处理复杂任务。
本文介绍了Game2World Engine,一个用于从游戏视频中移除UI的框架,旨在为视频世界模型创建更干净的训练数据。其中,GameCleaner模型在UI移除方面达到了最先进的成果。
Napster已转型为AI代理平台,说明AI训练数据如何迅速过时,导致模型在关于公司身份的信息上提供自信但不正确的答案。
这篇论文介绍了Task Model Induction,一种将真实计算机工作的屏幕录制分解为单独任务和目标树的方法,以更好地训练AI代理,与当前的摘要工具相比,在未见任务上的性能提高了30%。
文章对AI模型可能基于AI自身生成的数据进行训练提出了担忧,这可能导致模型崩溃等问题,并引用了Deezer移除数百万首AI生成歌曲以及AI创建的博客文章比例过高等例子。
Micro1,一家AI数据初创公司,在八个月内因对AI训练数据的高需求而达到5亿美元的年总收入运行率,尽管其规模仍小于竞争对手如Mercor和Handshake。
Y Combinator 的 Paper Club 专注于 AI 研究中的数据挑战,领域专家讨论训练数据和基准测试。
Humyn Labs正在通过将人类经验转化为使用多种传感器(如IMU、深度相机和手部追踪)的同步训练数据来解决机器人数据问题,使其对机器人训练有用。
Zhipu创始人Tang Jie讨论了AI扩展如何超越参数数量,涵盖训练数据、每次前向传播的计算量以及后训练等因素,并以GLM-5.3为例。
Meta/Oxford 的一项研究发现,如果语言和视觉理解一起训练,多模态模型需要的图像生成数据少得惊人,并提出了语言、图像理解和图像生成 token 的最佳比例为 70/25/5。研究还警告说,延迟视觉训练会导致“视觉懒惰”,即模型忽略图像。
一篇博客文章及配套推文探讨了随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值,讨论了来源、模型崩溃以及Anthropic的图书扫描。
讨论AI公司是否应面临版权诉讼,以强制其以合乎道德的方式获取训练数据;文章引用了Suno在德国的败诉,并主张法律应要求在使用人们的数据进行训练时获得同意。
Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。
作者观察到 ChatGPT 现在可以画出指定时间的表,指出一年前这还是一个典型的 AI 失败案例,因为训练数据过分偏向 10:10,并问到还有哪些其他的“10:10 问题”依然存在。
The tweet highlights the potential of agent harnesses to capture and distill experts' tacit knowledge as new training data, referencing a Berkeley AI Summit talk by Jianfeng Gao on agentic modeling as an emerging AI paradigm.