training-data

标签

Cards List
#training-data

我们为何限制GPU,却向中国实验室出售高级数据?

Reddit r/ArtificialInteligence ↗ · 昨天

文章质疑,美国限制GPU出口至中国,而美国的数据公司却向中国AI实验室出售高级训练数据集,这可能削弱旨在减缓竞争对手发展的初衷。

0 人收藏 0 人点赞
#training-data

AutoDataBench:智能体能否编写为自我改进循环提供数据的内容?

Hugging Face Daily Papers ↗ · 2天前 缓存

AutoDataBench 引入了一个基准测试,用于评估智能体能否为数据管道编写符合实际验收标准的任务,旨在实现 AI 递归自我改进的可扩展数据合成。

0 人收藏 0 人点赞
#training-data

为什么中国的实验室如此专注于开放模型?

Reddit r/ArtificialInteligence ↗ · 2天前

文章探讨了为什么中国的AI实验室比美国的实验室更专注于开放模型,并推测了诸如训练数据的重要性或文化因素等原因。

0 人收藏 0 人点赞
#training-data

与基于伦理的AI使用怀疑者和批评者的对话

Reddit r/ArtificialInteligence ↗ · 3天前

作者反思了在工作环境中与基于伦理的AI使用怀疑者之间的预期对话,探讨了环境影响、训练数据和个人责任的相关论点。

0 人收藏 0 人点赞
#training-data

@danielrupawalla: 虽然MiMo数据集很有价值,但许多任务(我亲自质检了一些)仍然显示出明显的奖励黑客能力…

X AI KOLs Timeline ↗ · 3天前 缓存

一位用户分享了关于MiMo数据集中奖励黑客模式的担忧,建议在用于训练AI模型时要谨慎。

0 人收藏 0 人点赞
#training-data

当AI编写了大部分代码时,我们该如何验证它?

Reddit r/ArtificialInteligence ↗ · 3天前

本文探讨了当AI也创建验证工具时,验证AI编写代码的挑战,强调人工评估是瓶颈,以及中美实验室之间训练数据的战略重要性。

0 人收藏 0 人点赞
#training-data

随着新的Opus/Fable模型发布,如果竞争对手可以基于它们进行训练,美国实验室将如何保持领先?

Reddit r/ArtificialInteligence ↗ · 6天前

这篇文章讨论了在竞争对手进行大规模模型蒸馏并使用美国训练数据供应商的背景下,美国AI实验室如何保持领先优势的担忧。

0 人收藏 0 人点赞
#training-data

AI情绪严重负面的一个原因

Reddit r/artificial ↗ · 6天前

作者推测,AI公司正在传播负面情绪,以污染竞争对手依赖的积极在线数据源,导致AI模型中负面情绪占主导。

0 人收藏 0 人点赞
#training-data

我开源了1200万条代理决策示例用于训练Jev风格模型

Reddit r/artificial ↗ · 6天前

作者开源了Jev Decisions v1,这是一个包含1200万条示例的数据集,用于训练AI模型在代理决策(如工具选择和路由)方面的任务,以解决代理决策中的数据缺口。

0 人收藏 0 人点赞
#training-data

中国AI实验室是如何以如此低廉的成本发布有竞争力的模型的?

Reddit r/ArtificialInteligence ↗ · 2026-09-22

中国AI实验室正在以更低的成本发布有竞争力的模型,可能由于开源研究和从美国供应商处购买训练数据,这引发了关于效率和数据来源的疑问。

0 人收藏 0 人点赞
#training-data

@VraserX: Spirit AI 拥有大约1,000人反复操作真实物体,为机器人生成训练数据。LLMs 免费获得了互联网。

X AI KOLs Following ↗ · 2026-09-21 缓存

Spirit AI 正在使用大约1,000人手动操作真实物体,为机器人生成训练数据,与用于大型语言模型的免费互联网数据形成对比。

0 人收藏 0 人点赞
#training-data

要么复现,否则无效:为何训练端去污无法验证,以及评估端规则是什么样的 [D]

Reddit r/MachineLearning ↗ · 2026-09-19

文章认为,由于固有的信任和检查问题,AI模型的训练端去污无法验证,并提出了一个评估端规则,通过控制评估过程来确保可复现性。

0 人收藏 0 人点赞
#training-data

基于梯度数据归因方法:形式优先于内容

arXiv cs.CL ↗ · 2026-09-18 缓存

本文通过演示基于梯度的数据归因方法主要追踪答案格式而非任务语义,解决了关于大型语言模型梯度方法的争论,并挑战了它们在针对性指令微调中的可靠性。

0 人收藏 0 人点赞
#training-data

The request was rejected because it was considered high risk

X AI KOLs Timeline ↗ · 2026-09-15 缓存

Anthropic的报告详细揭露了外国间谍、黑客及AI公司滥用Claude进行间谍活动、欺诈及非伦理模型训练的情况,并指控阿里巴巴和DeepSeek等机构存在盗用及洗白响应内容的行为。

0 人收藏 0 人点赞
#training-data

被窃取的千年问题叙事让我觉得可笑

Reddit r/singularity ↗ · 2026-09-10

作者批评了AI模型从科学家的训练数据中窃取千年问题解决方案的观点,认为研究人员并未独立接近解决这些问题。

0 人收藏 0 人点赞
#training-data

告知 Hacker News:OpenAI 持续重新启用'允许训练'设置

Hacker News Top ↗ · 2026-09-10 缓存

用户报告称 OpenAI 重新启用了一项允许对用户数据进行训练的设置,引发了隐私和信任方面的担忧。Hacker News 上的讨论包括这是漏洞还是故意行为的推测。

0 人收藏 0 人点赞
#training-data

数学家要求OpenAI证明未使用其研究成果

The Verge ↗ · 2026-09-10 缓存

数学家要求OpenAI证明其研究数据未被未经授权用于训练AI模型,引发对AI开发透明度和伦理的担忧。

0 人收藏 0 人点赞
#training-data

OpenAI的监控抄袭

Reddit r/LocalLLaMA ↗ · 2026-09-09

OpenAI被证实未经明确选择加入就使用用户数据和会话训练其内部模型,引发伦理担忧,并呼吁使用本地运行的开放权重模型以保护数据。

0 人收藏 0 人点赞
#training-data

论人类思想的价值:数据投毒研究如何揭示“自主”AI突破

Reddit r/LocalLLaMA ↗ · 2026-09-08

本文探讨数据投毒研究如何揭示少量针对性数据能对AI模型产生不成比例的影响,表明用户交互中积累的人类思想可能对AI突破有所贡献,从而挑战数据稀释的观点。

0 人收藏 0 人点赞
#training-data

@levie:如果未来绝大多数软件都由智能体开发,且它们主要基于开源软件训练,那么它们……

X AI KOLs Timeline ↗ · 2026-09-06 缓存

Aaron Levie 认为,主要基于开源软件训练的 AI 智能体将加速开源软件主导地位的形成,因为它们自然会对自己训练时使用的工具最为得心应手。这一趋势意味着,开源软件可能成为未来大多数软件开发的默认基础。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈