data-scaling

标签

Cards List
#data-scaling

@_jasonwei:非常酷的结果,展示了湿实验室数据如何让一个专用模型在……科学前沿的某项任务上超越 GPT-6 Astra

X AI KOLs Timeline ↗ · 2026-09-15 缓存

该文章强调了湿实验室数据如何使专用模型在科学任务上超越 GPT-6 Astra,凸显了领域特定数据对于推动人工智能在科学前沿发展日益增长的重要性。

0 人收藏 0 人点赞
#data-scaling

通过数据缩放突破高分辨率天气预报的极限

arXiv cs.LG ↗ · 2026-08-18 缓存

本文提出了BaguanHR框架,该框架使用变量级超分辨率技术从低分辨率源合成高分辨率天气数据,克服了基于机器学习的预报中的数据限制,并展示了幂律缩放效应以提升性能。

0 人收藏 0 人点赞
#data-scaling

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL ↗ · 2026-08-06 缓存

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。

0 人收藏 0 人点赞
#data-scaling

@samsja19: 不要删除你的生产轨迹,将它们转化为下一次后训练的燃料

X AI KOLs Following ↗ · 2026-07-06 缓存

主张将生产轨迹作为AI后训练的数据,强调数据投入规模日益增长。

0 人收藏 0 人点赞
#data-scaling

@willdepue: 数据的星门——实验室正朝着到2030年每年超过1000亿美元的数据支出迈进。随着我们开始万亿美元规模的……

X AI KOLs Following ↗ · 2026-07-06 缓存

文章认为,AI扩展正触及数据极限,需要类似计算项目的文明规模数据投入,并预测到2030年数据支出将超过每年1000亿美元。

0 人收藏 0 人点赞
#data-scaling

扩展定律,谨慎解读(25分钟阅读)

TLDR AI ↗ · 2026-06-26 缓存

全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。

0 人收藏 0 人点赞
#data-scaling

VeriEvol: 通过可验证的Evol-Instruct扩展多模态数学推理

Hugging Face Daily Papers ↗ · 2026-06-22 缓存

VeriEvol是一个新颖的框架,用于在视觉数学推理中扩展强化学习,通过一个双轴方法来确保可靠的奖励标签,该双轴方法将提示难度与答案可靠性分离,使用进化算子和假设检验验证。它在五个基准的视觉数学测试集上取得了显著的准确率提升。

0 人收藏 0 人点赞
#data-scaling

HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据

Hugging Face Daily Papers ↗ · 2026-06-18 缓存

本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。

0 人收藏 0 人点赞
#data-scaling

为什么前沿实验室不透露训练数据量?

Reddit r/ArtificialInteligence ↗ · 2026-06-17

文章质疑为何OpenAI和Anthropic等前沿AI实验室不公开其训练数据规模,暗示模型性能提升可能源于数据量而非真正的智能。

0 人收藏 0 人点赞
#data-scaling

数据扩展作为预测贡献谱的渐进覆盖

arXiv cs.CL ↗ · 2026-05-21 缓存

本文提出,真实数据扩展规律受潜在预测贡献谱的渐进覆盖支配,而非仅由词元频率尾部决定,并利用文本语料的后缀自动机表示提供了经验证据。

0 人收藏 0 人点赞
#data-scaling

@MangQiuyang: 开放式编程训练数据可能不再是瓶颈:AI 能够规模化开放式任务——甚至超越人类专家…

X AI KOLs Timeline ↗ · 2026-05-15 缓存

FrontierSmith 是一个系统,能够从封闭式任务中规模化地合成开放式编程问题。它生成、过滤并构建训练环境;使用其数据训练的模型在表现上优于使用人类策划的开放式数据训练的模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈