training-data

标签

Cards List
#training-data

@corbin_braun: 当前的影响者是下一代影响者的训练数据

X AI KOLs Following · 2026-06-23

一条推文指出,当前的社交媒体影响者成为了下一代AI生成影响者的训练数据。

0 人收藏 0 人点赞
#training-data

OpenThoughts-Agent: 面向智能体模型的数据配方

Hugging Face Daily Papers · 2026-06-23 缓存

本文介绍了OpenThoughts-Agent,一个开源的用于训练智能体语言模型的数据整理流程,在七项基准测试中取得了44.8%的平均准确率,并通过系统性实验超越了先前的开源数据集。

0 人收藏 0 人点赞
#training-data

The data black hole at the center of AI

Reddit r/artificial · 2026-06-21 缓存

本文深入分析了AI的样本效率远低于人类的问题,指出前沿模型需要海量领域特定数据,而人类仅需少量示例即可学习,这种数据黑洞是当前AI发展的核心瓶颈。文章通过多个比较(标记量、机器人操控、驾驶)和反驳常见反对意见,论证了这一差距的严峻性,并探讨了对AI自动化目标的影响。

0 人收藏 0 人点赞
#training-data

那么,模型究竟是如何学会制作冰毒的呢?

Reddit r/artificial · 2026-06-20

一篇评论文章认为,AI模型从训练数据中获取危险知识,而像Anthropic和OpenAI这样的公司依赖容易破解的拒绝过滤器,而非真正移除有害能力,优先考虑速度而非安全。

0 人收藏 0 人点赞
#training-data

《大西洋月刊》创建了用于训练AI的音乐可搜索数据库

The Verge · 2026-06-20 缓存

《大西洋月刊》创建了一个包含数百万首用于训练AI模型的音乐曲目的可搜索数据库,允许公众搜索四个数据集,包括来自Google和Stability AI的数据集。

0 人收藏 0 人点赞
#training-data

你存在于权重中吗?

Product Hunt · 2026-06-20

一个工具,让你检查你的数据是否被包含在大语言模型的训练集中,探索AI中的数字永生概念。

0 人收藏 0 人点赞
#training-data

为什么前沿实验室不透露训练数据量?

Reddit r/ArtificialInteligence · 2026-06-17

文章质疑为何OpenAI和Anthropic等前沿AI实验室不公开其训练数据规模,暗示模型性能提升可能源于数据量而非真正的智能。

0 人收藏 0 人点赞
#training-data

将您的编程会话捐赠至开放的CC-BY-4.0数据集,以帮助训练开放权重和开源模型

Reddit r/LocalLLaMA · 2026-06-16

一项名为Trace Commons的新倡议旨在将编码智能体的追踪记录收集到开放CC-BY-4.0数据集中,以帮助训练开放权重和开源模型,从而对抗来自Anthropic和OpenAI的专有模型的数据优势。

0 人收藏 0 人点赞
#training-data

DeMix:通过影响向量调试混合错误类型的训练数据

arXiv cs.LG · 2026-06-11 缓存

DeMix 是一个新颖的框架,通过分析影响向量来检测错误训练样本并识别其具体错误类型(标签错误、特征错误、虚假关联),在数据修复后实现了调试F1分数提升22.61%和任务性能提升9.32%。

0 人收藏 0 人点赞
#training-data

ISE:一种基于执行的面向多轮操作系统代理轨迹的合成方案

arXiv cs.CL · 2026-06-11 缓存

本文介绍了一种名为ISE的三阶段合成范式,用于生成带有基于执行的多轮操作系统代理轨迹,并证明在生成的ISE-Trace数据集上进行微调能显著提升代理在ClawEval上的性能。

0 人收藏 0 人点赞
#training-data

@rohanpaul_ai: 一篇关于推理模型训练后如何改进的入门论文 表明更好的推理模型较少依赖原始……

X AI KOLs Following · 2026-06-07 缓存

这篇入门论文探讨了推理模型在训练后如何改进,认为有效的推理数据更多地依赖于可检查的训练证据而非原始数据量。它根据验证方法对推理数据进行分类,并强调保留混乱的智能体数据以获取学习信号。

0 人收藏 0 人点赞
#training-data

LIMMT:动作追踪中的少即是多

Hugging Face Daily Papers · 2026-06-05 缓存

本文介绍了LIMMT,这是一项以数据为中心的研究,表明使用高质量、极小的运动数据子集(不到AMASS的3%)进行训练,在基于物理的人形动作追踪方面优于使用完整数据集,并通过物理可行性、多样性和复杂性来定义运动数据质量。

0 人收藏 0 人点赞
#training-data

@anyscalecompute:GPUs在孟买,训练数据在爱荷华?跨区域读取在每个训练周期都带来开销。我们将@Alluxio NVMe缓存放在…

X AI KOLs Following · 2026-06-04 缓存

Anyscale展示了通过使用Alluxio NVMe缓存和Ray Data,跨区域训练数据读取速度提升了20倍,显示1TB数据的缓存预热读取时间从4,241秒降至208秒。

0 人收藏 0 人点赞
#training-data

模型崩塌的有趣之处不在于技术,而在于认识论

Reddit r/AI_Agents · 2026-06-01

本文探讨模型崩塌不是技术缺陷,而是认识论问题:当AI模型的输出成为自身输入时,模型对现实的表征逐渐扁平化为一种自我指涉的平均值,这引发了我们如何区分一个建模世界的模型与一个只建模自身的模型的问题。

0 人收藏 0 人点赞
#training-data

数据并不稀缺,稀缺的是你的想象力(8分钟阅读)

TLDR AI · 2026-05-29 缓存

Asuka Zheng认为,关于'训练数据即将耗尽'的恐慌是错位的;真正的稀缺在于收集多样化、长周期数据时的想象力不足,她用自己的SRE替代项目及更广泛的研究趋势说明了这一点。

0 人收藏 0 人点赞
#training-data

在答案正确的长思维链训练轨迹中诊断有害延续

Hugging Face Daily Papers · 2026-05-28 缓存

本文识别了在LLM SFT的答案正确的长思维链训练轨迹中的有害延续,其特征为不确定性-几何不匹配,并提出了一种轻量级边界代理方法来去除它们。

0 人收藏 0 人点赞
#training-data

灯塔里的埃利亚斯,又是?诊断LLM故事的低多样性

arXiv cs.CL · 2026-05-27 缓存

本文诊断了LLM生成故事的低多样性问题,发现88.3%的采样故事包含11个常见词汇之一(例如埃利亚斯、灯塔),且这些词汇在不同模型间普遍存在,并将这种同质性归因于后训练数据和对齐,而非预训练数据中的普遍存在。

0 人收藏 0 人点赞
#training-data

密集检索器中的位置偏差是内建的还是从数据中学习到的?

Hugging Face Daily Papers · 2026-05-26 缓存

本文研究了密集检索器中位置偏差的来源是架构还是训练数据,发现训练数据分布强烈影响偏差,而均衡训练可将敏感性降低高达87%,同时保持检索性能。

0 人收藏 0 人点赞
#training-data

AI生成代码的质量

Reddit r/AI_Agents · 2026-05-25

这篇文章讨论了一个担忧:随着AI工具生成越来越多的代码,未来基于这些合成代码训练的模型可能会质量下降、原创性降低,并询问像OpenAI、Anthropic和GitHub这样的主要AI实验室计划如何应对这个问题。

0 人收藏 0 人点赞
#training-data

大脑-LLM对齐受训练数据影响,而非语言类型学

arXiv cs.CL · 2026-05-25 缓存

本文利用fMRI数据和多种LLM,研究了英语、中文和法语中的大脑-LLM对齐,发现训练语言主导性和类型距离(而非英语固有的优势)驱动了对齐模式。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈