training-data

标签

Cards List
#training-data

OpenAI可能在版权战中对新闻机构犯下致命错误

Ars Technica · 2026-07-09 缓存

OpenAI被控隐藏和删除与《纽约时报》版权诉讼相关的ChatGPT日志,可能削弱其合理使用辩护,面临制裁呼声。

0 人收藏 0 人点赞
#training-data

"Grok 4.5 在 CursorBench 上具有优势:Cursor 代码库的一个早期快照在训练中被无意包含"

Reddit r/singularity · 2026-07-09 缓存

CursorBench 显示,Grok 4.5 的高分部分是由于在训练数据中无意包含了 Cursor 代码库的早期快照。相关数据已从未来的模型中移除。

0 人收藏 0 人点赞
#training-data

这家初创公司认为机器人技术即将迎来它的ChatGPT时刻

TechCrunch AI · 2026-07-08 缓存

General Intuition是一家初创公司,正在构建基于视频游戏数据训练的机器人基础模型。该公司认为机器人技术将遵循自然语言处理的模式,采用通用模型,并已筹集3.2亿美元,估值23亿美元,以追求这一愿景。

0 人收藏 0 人点赞
#training-data

为什么这位CEO认为电子游戏比互联网更适合作为训练数据

TechCrunch AI · 2026-07-08 缓存

General Intuition CEO Pim de Witte 认为,使用电子游戏数据训练AI可能是实现通用人工智能的关键,因为游戏提供了纯文本模型所缺乏的空间和时间理解能力。这家由贝索斯支持的初创公司最近筹集了3.2亿美元。

0 人收藏 0 人点赞
#training-data

Image2Sim: 通过生成式神经模拟器实现具身导航规模化

Hugging Face Daily Papers · 2026-07-07 缓存

Image2Sim是一个神经模拟框架,它能从RGB-D图像创建高保真交互环境,为具身导航智能体提供可扩展的训练。该框架生成了近20K场景和超过1000万训练样本,在基准测试上展现了显著改进,并实现了有效的真实世界零样本迁移。

0 人收藏 0 人点赞
#training-data

PRX 第4部分:我们的数据策略

Hugging Face Blog · 2026-07-06 缓存

Photoroom 详细介绍了训练 PRX 的数据策略,包括组装多样化数据集、使用 VLM 重新生成描述,以及利用 Mosaic Data Shards 实现高效训练。

0 人收藏 0 人点赞
#training-data

@no_stp_on_snek: 微调现场笔记 每个模型家族对话格式不同,这些格式规则悄悄破坏...

X AI KOLs Following · 2026-07-06 缓存

一条推文警告说,不同的AI模型家族有独特的对话格式规则,这些规则会悄然破坏训练数据,要求开发者逐个学习每个家族的特性。

0 人收藏 0 人点赞
#training-data

@patio11:这是一个相当悲观的想法,但在与市场领先的LLM打交道时,你偶尔会看到一些端倪。

X AI KOLs Following · 2026-07-06 缓存

一条推文强调了罗宾·汉森的观察:当前的LLM正受到低地位清晰思考者的影响,但最终可能会像高地位人类一样学会忽视他们。

0 人收藏 0 人点赞
#training-data

@QuixiAI: DolphinMath 可生成适用于预训练、中期训练、SFT 和 RL 的数学题,数量不限…

X AI KOLs Following · 2026-07-05 缓存

DolphinMath 是一款工具,能生成带步骤解答的数学题,适用于从预训练到 RL 的各个训练阶段,覆盖小学到研究生水平。

0 人收藏 0 人点赞
#training-data

Reddit用户是否应该关注他们的帖子如何被用于训练AI?

Reddit r/artificial · 2026-07-03 缓存

本文认为,随着网络充斥着合成内容,Reddit上混乱但真实的人类对话对于训练AI正变得越来越有价值,凸显了经济向稀缺人类行为数据的转变。

0 人收藏 0 人点赞
#training-data

超过20家出版商起诉OpenAI和微软,指控其使用其内容训练ChatGPT

Reddit r/artificial · 2026-06-29 缓存

美国35家报纸出版商已对OpenAI和微软提起诉讼,指控这两家公司未经许可抓取其受版权保护且需付费的内容用于训练ChatGPT,损害了本地新闻业。

0 人收藏 0 人点赞
#training-data

通过将解决方案投影到评估环境来微调AI代理

Reddit r/AI_Agents · 2026-06-29

一位研究人员描述了一种称为'投影'的方法,通过将可验证的正确解投影到代理可遍历的地图上,在有限训练数据下提高了网络安全任务的性能。

0 人收藏 0 人点赞
#training-data

我构建了一个工具,可以将您的 Claude Code 会话转化为用于本地模型的微调数据。

Reddit r/LocalLLaMA · 2026-06-27

一款名为 claude_converter 的新开源工具,可将 Claude Code 的会话日志转换为兼容 TRL/SFTTrainer、Axolotl 和 LLaMA-Factory 的微调数据集,使开发者能够利用真实的编程对话来训练本地模型。

0 人收藏 0 人点赞
#training-data

如今未经许可抓取数据用于AI训练突然变得不可取了?

Reddit r/artificial · 2026-06-27

一篇关于对AI训练中网络爬取态度转变的评论,质疑为何突然谴责未经许可的数据收集。

0 人收藏 0 人点赞
#training-data

《纽约时报》抨击微软为OpenAI构建侵犯版权的超级计算机

Ars Technica · 2026-06-26 缓存

《纽约时报》更新了对微软和OpenAI的版权诉讼,指控微软专门构建了一台超级计算机,用于在未经许可的情况下训练AI处理受版权保护的作品,包括《纽约时报》的文章。

0 人收藏 0 人点赞
#training-data

小编辑,大模型:维基百科倡导如何影响大语言模型价值观

arXiv cs.CL · 2026-06-25 缓存

本文证明,一个协调的小规模维基百科编辑活动能够显著影响语言模型处理特定话题的方式,以动物福利为案例研究。

0 人收藏 0 人点赞
#training-data

@Dorialexander: 因为我一直关注RL环境市场:Anthropic确实做了大量的Slack强化学习

X AI KOLs Following · 2026-06-24 缓存

一条推文强调,Anthropic利用Slack对话进行了大规模的强化学习,Andrej Karpathy强调这并非像通常被误解的那样是一个简单的Slack机器人功能。

0 人收藏 0 人点赞
#training-data

@cuisitekp: 9B 的模型,把比它大好几倍的模型干下去了。 Ai2 和华盛顿大学那拨做 OLMo / Tülu 的人,放出一篇新论文叫 Tmax,自称是目前最强的开源「终端 agent」RL 训练配方。 成绩:一个 9B 模型在 Terminal-Be…

X AI KOLs Timeline · 2026-06-24 缓存

Ai2和华盛顿大学发布论文Tmax,提出目前最强的开源终端智能体RL训练配方。仅用9B参数模型在Terminal-Bench 2.0上击败更大模型,关键在于低成本生成大量可验证训练数据,而非模型规模或算法。

0 人收藏 0 人点赞
#training-data

Autodata:一个用于创建高质量合成数据的智能体数据科学家

Hugging Face Daily Papers · 2026-06-24 缓存

Autodata是一种方法,通过元优化使AI智能体能够扮演数据科学家的角色,创建高质量合成训练数据,在计算机科学、法律推理和数学任务等领域实现了性能提升。

0 人收藏 0 人点赞
#training-data

泄露文件详述俄罗斯社会设计机构构建虚假参考平台以污染AI训练数据和搜索索引

Reddit r/artificial · 2026-06-23

泄露文件揭露俄罗斯的“Project 2026”,由社会设计机构运营,旨在创建虚假参考平台(如德国维基百科克隆版)以污染AI训练数据和搜索索引,目的是将俄罗斯叙事嵌入AI回复中。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈