标签
一篇博客文章及配套推文探讨了随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值,讨论了来源、模型崩溃以及Anthropic的图书扫描。
讨论AI公司是否应面临版权诉讼,以强制其以合乎道德的方式获取训练数据;文章引用了Suno在德国的败诉,并主张法律应要求在使用人们的数据进行训练时获得同意。
Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。
作者观察到 ChatGPT 现在可以画出指定时间的表,指出一年前这还是一个典型的 AI 失败案例,因为训练数据过分偏向 10:10,并问到还有哪些其他的“10:10 问题”依然存在。
The tweet highlights the potential of agent harnesses to capture and distill experts' tacit knowledge as new training data, referencing a Berkeley AI Summit talk by Jianfeng Gao on agentic modeling as an emerging AI paradigm.
Truffle Security 与 Julien Chaumond 合作,在 HuggingFace 上执行了最大规模的 AI 训练数据秘密扫描,在 6,003 个公共数据集中发现了 221,303 个有效的唯一凭据。
作者提出一个正式的训练前控制层,用于审计训练数据工件,并基于明确标准给出判定(通过/不通过),作为数据准备与训练之间缺失的门控,并邀请讨论其实用性。
Encord和Zander Labs正在实验用脑电波头戴设备采集更丰富的物理AI训练数据,旨在解决真实世界机器人数据稀缺的问题。
关于实验室训练10T参数模型可能使用的数据来源的讨论,包括合成推理链和人类生成的痕迹,以及对触及数据墙的担忧。
DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。
Anthropic被指控未经许可使用受版权保护的书籍来训练其大语言模型,因此遭到起诉。
本文介绍了移动字母(Moving Alphabet),一个用于受控实验的程序化测试平台,研究数据分布和字幕质量如何影响文本到视频模型,揭示了数据整理的关键见解。
TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。
对向前沿AI实验室出售训练数据这一蓬勃发展的业务进行了深入分析,详细介绍了六种不同的数据产品以及市场的财务动态。
一次黑客事件揭露,AI音乐生成器Suno通过从YouTube、Genius和Deezer抓取数百万首歌曲来训练其模型,证实了版权侵权的指控,并暴露了客户数据。
对AI音乐生成器Suno的黑客攻击显示,它涉嫌从YouTube、Deezer等来源抓取了数十年的音频作为训练数据,在各大唱片公司起诉期间引发了版权和DMCA方面的担忧。
《纽约时报》指控OpenAI误导法庭,声称无法搜索训练数据中的受版权保护材料,但此前曾这样做过并删除了数十亿聊天记录。这起案件引发对AI公司透明度和问责制的担忧。