training-data

标签

Cards List
#training-data

语言、语言模型与我们正在讨论的内容

arXiv cs.CL ↗ · 2026-09-04 缓存

本文将语言模型视为语言产物,使用意大利模型来探究其训练过程,并质疑其对语言的表征。文章主张在自然语言处理中区分技术产品和研究工具。

0 人收藏 0 人点赞
#training-data

大型语言模型能否捕捉训练数据中的多样性?

arXiv cs.CL ↗ · 2026-09-03 缓存

本文通过比较生成输出与训练数据的熵来研究大型语言模型中的条件多样性差距,并提出一个信息论框架来度量和缓解这一差距。

0 人收藏 0 人点赞
#training-data

有人说,我完全用Qwen3.8-27B Q4模型生成的Minecraft克隆并不那么令人印象深刻,因为Minecraft在训练数据中,所以我让模型添加了四个可能不在其中的东西。

Reddit r/LocalLLaMA ↗ · 2026-08-30

一个人使用Qwen3.8-27B Q4模型构建了Minecraft克隆,并添加了自定义功能,以应对批评称Minecraft数据影响了训练。

0 人收藏 0 人点赞
#training-data

诡异爬虫

Lobsters Hottest ↗ · 2026-08-29 缓存

AI爬虫通过低效抓取git提交以获取训练数据,导致kernel.org的CPU负载显著增加,其消耗的资源超过了所有合法访问的总和。

0 人收藏 0 人点赞
#training-data

谁在训练你的AI聊天数据?主要玩家审计

Reddit r/ArtificialInteligence ↗ · 2026-08-27 缓存

文章对OpenAI和Anthropic等主要AI提供商进行审计,发现他们默认在消费级计划中使用用户聊天数据进行训练,而退出选项往往隐藏在设置中。

0 人收藏 0 人点赞
#training-data

据报道,Google正与AI编程初创企业Mechanize就15亿美元交易进行深入谈判(阅读时间4分钟)

TLDR AI ↗ · 2026-08-27

据报道,Google正在与AI编程初创公司Mechanize进行高级谈判,拟达成15亿美元的交易。Mechanize开发虚拟环境、基准测试和训练数据,以帮助AI代理处理复杂任务。

0 人收藏 0 人点赞
#training-data

Game2World引擎:解锁真实游戏视频以用于世界模型训练

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

本文介绍了Game2World Engine,一个用于从游戏视频中移除UI的框架,旨在为视频世界模型创建更干净的训练数据。其中,GameCleaner模型在UI移除方面达到了最先进的成果。

0 人收藏 0 人点赞
#training-data

Napster的主页现在完全是AI代理。这是训练数据过时速度的一个简洁测试案例。

Reddit r/artificial ↗ · 2026-08-23

Napster已转型为AI代理平台,说明AI训练数据如何迅速过时,导致模型在关于公司身份的信息上提供自信但不正确的答案。

0 人收藏 0 人点赞
#training-data

@rohanpaul_ai:新的Stanford + Carnegie论文。真实工作的屏幕录制看起来像是代理的免费训练数据。它们并不是,因为…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

这篇论文介绍了Task Model Induction,一种将真实计算机工作的屏幕录制分解为单独任务和目标树的方法,以更好地训练AI代理,与当前的摘要工具相比,在未见任务上的性能提高了30%。

0 人收藏 0 人点赞
#training-data

AI会(或将会)反向学习吗?(因为其大部分训练数据现在是由AI生成的)

Reddit r/ArtificialInteligence ↗ · 2026-08-21

文章对AI模型可能基于AI自身生成的数据进行训练提出了担忧,这可能导致模型崩溃等问题,并引用了Deezer移除数百万首AI生成歌曲以及AI创建的博客文章比例过高等例子。

0 人收藏 0 人点赞
#training-data

AI数据初创公司Micro1在AI训练热潮中达到5亿美元总收入运行率

TechCrunch AI ↗ · 2026-08-21 缓存

Micro1,一家AI数据初创公司,在八个月内因对AI训练数据的高需求而达到5亿美元的年总收入运行率,尽管其规模仍小于竞争对手如Mercor和Handshake。

0 人收藏 0 人点赞
#training-data

@garrytan: YC 是专为 AI 研究者打造的 YC

X AI KOLs Timeline ↗ · 2026-08-20 缓存

Y Combinator 的 Paper Club 专注于 AI 研究中的数据挑战,领域专家讨论训练数据和基准测试。

0 人收藏 0 人点赞
#training-data

@rohanpaul_ai:大语言模型已经有了互联网。机器人必须建立自己的互联网。这正是Humyn Labs正在解决的数据问题。@hu…

X AI KOLs Timeline ↗ · 2026-08-20 缓存

Humyn Labs正在通过将人类经验转化为使用多种传感器(如IMU、深度相机和手部追踪)的同步训练数据来解决机器人数据问题,使其对机器人训练有用。

0 人收藏 0 人点赞
#training-data

@rohanpaul_ai: Zhipu创始人Tang Jie的精彩文章。AI扩展正在超越参数增长。“有多少参数?”正变得……

X AI KOLs Following ↗ · 2026-08-20 缓存

Zhipu创始人Tang Jie讨论了AI扩展如何超越参数数量,涵盖训练数据、每次前向传播的计算量以及后训练等因素,并以GLM-5.3为例。

0 人收藏 0 人点赞
#training-data

@rohanpaul_ai:Meta/Oxford 研究发现,多模态模型可能只需要极少量的图像生成数据,如果语言和视觉…

X AI KOLs Following ↗ · 2026-08-14 缓存

Meta/Oxford 的一项研究发现,如果语言和视觉理解一起训练,多模态模型需要的图像生成数据少得惊人,并提出了语言、图像理解和图像生成 token 的最佳比例为 70/25/5。研究还警告说,延迟视觉训练会导致“视觉懒惰”,即模型忽略图像。

0 人收藏 0 人点赞
#training-data

随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值?

Reddit r/artificial ↗ · 2026-08-12

一篇博客文章及配套推文探讨了随着互联网充满合成内容,生成式AI之前的数据是否变得更有价值,讨论了来源、模型崩溃以及Anthropic的图书扫描。

0 人收藏 0 人点赞
#training-data

为什么关于用版权法阻止AI的讨论这么少?

Reddit r/ArtificialInteligence ↗ · 2026-08-09

讨论AI公司是否应面临版权诉讼,以强制其以合乎道德的方式获取训练数据;文章引用了Suno在德国的败诉,并主张法律应要求在使用人们的数据进行训练时获得同意。

0 人收藏 0 人点赞
#training-data

@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……

X AI KOLs Following ↗ · 2026-08-06 缓存

Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。

0 人收藏 0 人点赞
#training-data

TIL:AI 能绘制显示实际时间的表

Reddit r/singularity ↗ · 2026-08-04

作者观察到 ChatGPT 现在可以画出指定时间的表,指出一年前这还是一个典型的 AI 失败案例,因为训练数据过分偏向 10:10,并问到还有哪些其他的“10:10 问题”依然存在。

0 人收藏 0 人点赞
#training-data

@turingbook: Harness(Agent)可能最大的价值,是到各行各业老法师的工作实际场景中,看他们怎么工作和思考的,记录和“蒸馏”他们的宝贵经验,这种数据原来可能都是隐性的。

X AI KOLs Timeline ↗ · 2026-08-02 缓存

The tweet highlights the potential of agent harnesses to capture and distill experts' tacit knowledge as new training data, referencing a Berkeley AI Summit talk by Jianfeng Gao on agentic modeling as an emerging AI paradigm.

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈