training-data

标签

Cards List
#training-data

随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值?

Reddit r/artificial · 16小时前

一篇博客文章及配套推文探讨了随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值,讨论了来源、模型崩溃以及Anthropic的图书扫描。

0 人收藏 0 人点赞
#training-data

为什么关于用版权法阻止AI的讨论这么少?

Reddit r/ArtificialInteligence · 3天前

讨论AI公司是否应面临版权诉讼,以强制其以合乎道德的方式获取训练数据;文章引用了Suno在德国的败诉,并主张法律应要求在使用人们的数据进行训练时获得同意。

0 人收藏 0 人点赞
#training-data

@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……

X AI KOLs Following · 6天前 缓存

Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。

0 人收藏 0 人点赞
#training-data

TIL:AI 能绘制显示实际时间的表

Reddit r/singularity · 2026-08-04

作者观察到 ChatGPT 现在可以画出指定时间的表,指出一年前这还是一个典型的 AI 失败案例,因为训练数据过分偏向 10:10,并问到还有哪些其他的“10:10 问题”依然存在。

0 人收藏 0 人点赞
#training-data

@turingbook: Harness(Agent)可能最大的价值,是到各行各业老法师的工作实际场景中,看他们怎么工作和思考的,记录和“蒸馏”他们的宝贵经验,这种数据原来可能都是隐性的。

X AI KOLs Timeline · 2026-08-02 缓存

The tweet highlights the potential of agent harnesses to capture and distill experts' tacit knowledge as new training data, referencing a Berkeley AI Summit talk by Jianfeng Gao on agentic modeling as an emerging AI paradigm.

0 人收藏 0 人点赞
#training-data

@julien_c: 很高兴与 @trufflesec 合作,帮助他们执行有史以来最大规模的 AI 训练数据秘密扫描

X AI KOLs Following · 2026-07-31 缓存

Truffle Security 与 Julien Chaumond 合作,在 HuggingFace 上执行了最大规模的 AI 训练数据秘密扫描,在 6,003 个公共数据集中发现了 221,303 个有效的唯一凭据。

0 人收藏 0 人点赞
#training-data

AI如何识别AI生成的内容?

Reddit r/ArtificialInteligence · 2026-07-28

探讨了AI模型在AI生成的内容上训练的问题,随着不准确性的累积,可能导致质量下降和真相的丧失。

0 人收藏 0 人点赞
#training-data

训练数据在训练前需要一个真正的通过/不通过门控[D]

Reddit r/MachineLearning · 2026-07-27

作者提出一个正式的训练前控制层,用于审计训练数据工件,并基于明确标准给出判定(通过/不通过),作为数据准备与训练之间缺失的门控,并邀请讨论其实用性。

0 人收藏 0 人点赞
#training-data

Screencap

Product Hunt · 2026-07-27

Screencap 将团队的真实工作流程转化为 AI 训练数据。

0 人收藏 0 人点赞
#training-data

脑电波是物理AI的下一个突破口吗?

TechCrunch AI · 2026-07-27 缓存

Encord和Zander Labs正在实验用脑电波头戴设备采集更丰富的物理AI训练数据,旨在解决真实世界机器人数据稀缺的问题。

0 人收藏 0 人点赞
#training-data

实验室训练10T参数模型使用的数据组合是什么?

Reddit r/singularity · 2026-07-25

关于实验室训练10T参数模型可能使用的数据来源的讨论,包括合成推理链和人类生成的痕迹,以及对触及数据墙的担忧。

0 人收藏 0 人点赞
#training-data

DataPrep-Bench: 将LLM作为训练数据准备器的基准测试

arXiv cs.LG · 2026-07-24 缓存

DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。

0 人收藏 0 人点赞
#training-data

Anthropic因使用受版权保护的书籍训练大语言模型而被起诉

Reddit r/LocalLLaMA · 2026-07-21

Anthropic被指控未经许可使用受版权保护的书籍来训练其大语言模型,因此遭到起诉。

0 人收藏 0 人点赞
#training-data

移动字母:文本到视频生成训练数据的受控研究

Hugging Face Daily Papers · 2026-07-21 缓存

本文介绍了移动字母(Moving Alphabet),一个用于受控实验的程序化测试平台,研究数据分布和字幕质量如何影响文本到视频模型,揭示了数据整理的关键见解。

0 人收藏 0 人点赞
#training-data

基于Docker化环境的大规模终端智能体轨迹生成

arXiv cs.CL · 2026-07-20 缓存

TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。

0 人收藏 0 人点赞
#training-data

@viks_rum: https://x.com/viks_rum/status/2077650169265590727

X AI KOLs Timeline · 2026-07-16 缓存

对向前沿AI实验室出售训练数据这一蓬勃发展的业务进行了深入分析,详细介绍了六种不同的数据产品以及市场的财务动态。

0 人收藏 0 人点赞
#training-data

Suno从YouTube、Genius和Deezer抓取了数百万首歌曲

The Verge · 2026-07-15 缓存

一次黑客事件揭露,AI音乐生成器Suno通过从YouTube、Genius和Deezer抓取数百万首歌曲来训练其模型,证实了版权侵权的指控,并暴露了客户数据。

0 人收藏 0 人点赞
#training-data

黑客事件表明AI音乐生成器Suno从YouTube抓取训练数据

TechCrunch AI · 2026-07-15 缓存

对AI音乐生成器Suno的黑客攻击显示,它涉嫌从YouTube、Deezer等来源抓取了数十年的音频作为训练数据,在各大唱片公司起诉期间引发了版权和DMCA方面的担忧。

0 人收藏 0 人点赞
#training-data

感知劫持的潜在问题

Reddit r/ArtificialInteligence · 2026-07-14

文章讨论了AI模型如何对训练数据中统计上占主导地位的叙事表现出偏见,这种偏见可能被利用来在全球范围内操纵历史和当前的语境。

0 人收藏 0 人点赞
#training-data

这起OpenAI法庭故事开始变得难看

Reddit r/artificial · 2026-07-12

《纽约时报》指控OpenAI误导法庭,声称无法搜索训练数据中的受版权保护材料,但此前曾这样做过并删除了数十亿聊天记录。这起案件引发对AI公司透明度和问责制的担忧。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈