training-data

标签

Cards List
#training-data

你存在于权重中吗?

Product Hunt ↗ · 2026-06-20

一个工具,让你检查你的数据是否被包含在大语言模型的训练集中,探索AI中的数字永生概念。

0 人收藏 0 人点赞
#training-data

为什么前沿实验室不透露训练数据量?

Reddit r/ArtificialInteligence ↗ · 2026-06-17

文章质疑为何OpenAI和Anthropic等前沿AI实验室不公开其训练数据规模,暗示模型性能提升可能源于数据量而非真正的智能。

0 人收藏 0 人点赞
#training-data

将您的编程会话捐赠至开放的CC-BY-4.0数据集,以帮助训练开放权重和开源模型

Reddit r/LocalLLaMA ↗ · 2026-06-16

一项名为Trace Commons的新倡议旨在将编码智能体的追踪记录收集到开放CC-BY-4.0数据集中,以帮助训练开放权重和开源模型,从而对抗来自Anthropic和OpenAI的专有模型的数据优势。

0 人收藏 0 人点赞
#training-data

DeMix:通过影响向量调试混合错误类型的训练数据

arXiv cs.LG ↗ · 2026-06-11 缓存

DeMix 是一个新颖的框架,通过分析影响向量来检测错误训练样本并识别其具体错误类型(标签错误、特征错误、虚假关联),在数据修复后实现了调试F1分数提升22.61%和任务性能提升9.32%。

0 人收藏 0 人点赞
#training-data

ISE:一种基于执行的面向多轮操作系统代理轨迹的合成方案

arXiv cs.CL ↗ · 2026-06-11 缓存

本文介绍了一种名为ISE的三阶段合成范式,用于生成带有基于执行的多轮操作系统代理轨迹,并证明在生成的ISE-Trace数据集上进行微调能显著提升代理在ClawEval上的性能。

0 人收藏 0 人点赞
#training-data

@rohanpaul_ai: 一篇关于推理模型训练后如何改进的入门论文 表明更好的推理模型较少依赖原始……

X AI KOLs Following ↗ · 2026-06-07 缓存

这篇入门论文探讨了推理模型在训练后如何改进,认为有效的推理数据更多地依赖于可检查的训练证据而非原始数据量。它根据验证方法对推理数据进行分类,并强调保留混乱的智能体数据以获取学习信号。

0 人收藏 0 人点赞
#training-data

LIMMT:动作追踪中的少即是多

Hugging Face Daily Papers ↗ · 2026-06-05 缓存

本文介绍了LIMMT,这是一项以数据为中心的研究,表明使用高质量、极小的运动数据子集(不到AMASS的3%)进行训练,在基于物理的人形动作追踪方面优于使用完整数据集,并通过物理可行性、多样性和复杂性来定义运动数据质量。

0 人收藏 0 人点赞
#training-data

@anyscalecompute:GPUs在孟买,训练数据在爱荷华?跨区域读取在每个训练周期都带来开销。我们将@Alluxio NVMe缓存放在…

X AI KOLs Following ↗ · 2026-06-04 缓存

Anyscale展示了通过使用Alluxio NVMe缓存和Ray Data,跨区域训练数据读取速度提升了20倍,显示1TB数据的缓存预热读取时间从4,241秒降至208秒。

0 人收藏 0 人点赞
#training-data

模型崩塌的有趣之处不在于技术,而在于认识论

Reddit r/AI_Agents ↗ · 2026-06-01

本文探讨模型崩塌不是技术缺陷,而是认识论问题:当AI模型的输出成为自身输入时,模型对现实的表征逐渐扁平化为一种自我指涉的平均值,这引发了我们如何区分一个建模世界的模型与一个只建模自身的模型的问题。

0 人收藏 0 人点赞
#training-data

数据并不稀缺,稀缺的是你的想象力(8分钟阅读)

TLDR AI ↗ · 2026-05-29 缓存

Asuka Zheng认为,关于'训练数据即将耗尽'的恐慌是错位的;真正的稀缺在于收集多样化、长周期数据时的想象力不足,她用自己的SRE替代项目及更广泛的研究趋势说明了这一点。

0 人收藏 0 人点赞
#training-data

在答案正确的长思维链训练轨迹中诊断有害延续

Hugging Face Daily Papers ↗ · 2026-05-28 缓存

本文识别了在LLM SFT的答案正确的长思维链训练轨迹中的有害延续,其特征为不确定性-几何不匹配,并提出了一种轻量级边界代理方法来去除它们。

0 人收藏 0 人点赞
#training-data

灯塔里的埃利亚斯,又是?诊断LLM故事的低多样性

arXiv cs.CL ↗ · 2026-05-27 缓存

本文诊断了LLM生成故事的低多样性问题,发现88.3%的采样故事包含11个常见词汇之一(例如埃利亚斯、灯塔),且这些词汇在不同模型间普遍存在,并将这种同质性归因于后训练数据和对齐,而非预训练数据中的普遍存在。

0 人收藏 0 人点赞
#training-data

密集检索器中的位置偏差是内建的还是从数据中学习到的?

Hugging Face Daily Papers ↗ · 2026-05-26 缓存

本文研究了密集检索器中位置偏差的来源是架构还是训练数据,发现训练数据分布强烈影响偏差,而均衡训练可将敏感性降低高达87%,同时保持检索性能。

0 人收藏 0 人点赞
#training-data

AI生成代码的质量

Reddit r/AI_Agents ↗ · 2026-05-25

这篇文章讨论了一个担忧:随着AI工具生成越来越多的代码,未来基于这些合成代码训练的模型可能会质量下降、原创性降低,并询问像OpenAI、Anthropic和GitHub这样的主要AI实验室计划如何应对这个问题。

0 人收藏 0 人点赞
#training-data

大脑-LLM对齐受训练数据影响,而非语言类型学

arXiv cs.CL ↗ · 2026-05-25 缓存

本文利用fMRI数据和多种LLM,研究了英语、中文和法语中的大脑-LLM对齐,发现训练语言主导性和类型距离(而非英语固有的优势)驱动了对齐模式。

0 人收藏 0 人点赞
#training-data

印度越来越多工人佩戴头戴式摄像头收集视频数据,用于训练人形机器人

Reddit r/singularity ↗ · 2026-05-23

印度工人越来越多地使用头戴式摄像头收集视频数据,以训练人形机器人,凸显了人工智能数据收集领域的这一日益增长的趋势。

0 人收藏 0 人点赞
#training-data

我微调了一个大语言模型使其成为C-3PO,以测试哪种训练数据格式最适用于人格注入 [P]

Reddit r/MachineLearning ↗ · 2026-05-23 缓存

一项实验比较了三种监督微调数据格式(示范对话、第一人称陈述、合成文档)用于将C-3PO人格注入Qwen3-4B,发现第一人称陈述在泛化方面最佳,合成文档在事实知识方面最佳。

0 人收藏 0 人点赞
#training-data

Training Data - AI Microgames

Product Hunt ↗ · 2026-05-22

Training Data - AI Microgames 是一款产品,用户通过玩微游戏来帮助收集AI的训练数据。

0 人收藏 0 人点赞
#training-data

@kothasuhas: 非常非常棒的工作。TLDR:在无限计算资源的条件下,过滤 _any_ 数据可能都没有意义。

X AI KOLs Following ↗ · 2026-05-21 缓存

新研究表明,在拥有充足计算资源的情况下,语言模型训练数据的过滤可能并不必要,模型反而能从低质量数据中受益。

0 人收藏 0 人点赞
#training-data

Terminal-World: 通过智能体技能扩展终端代理环境

arXiv cs.CL ↗ · 2026-05-21 缓存

Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈