synthetic-data

标签

Cards List
#synthetic-data

ToolGrad: 使用文本梯度高效生成工具使用数据集(3分钟阅读)

TLDR AI ↗ · 2026-09-14 缓存

ToolGrad 介绍了一种使用文本梯度生成工具使用数据集的高效方法,以更低的成本实现更好的大语言模型训练,并提升在分布外任务上的性能。

0 人收藏 0 人点赞
#synthetic-data

生成一致的企业数据:多系统商业数据的综合与无参考评估

arXiv cs.AI ↗ · 2026-09-12 缓存

本文介绍了一个无需真实数据集即可生成一致虚构企业数据的生成器,采用无参考评估方法确保数据真实性,并提供了一个托管服务,用于根据业务问题构建关系数据库。

0 人收藏 0 人点赞
#synthetic-data

寡头几乎无法在多模型生态系统中引导模型崩溃

arXiv cs.AI ↗ · 2026-09-12 缓存

本文研究了在多模型生态系统中,当AI生成的文本被回收用于训练数据时发生的模型崩溃。研究发现,市场集中度对崩溃的速度或终点几乎没有影响,这主要受训练数据源的影响。

0 人收藏 0 人点赞
#synthetic-data

@kadirnardev:我之前非常专注于持续预训练和收集真实世界语音数据,但在与 Maxime L… 交谈后,我了解到强化学习和合成数据非常重要。

X AI KOLs Following ↗ · 2026-09-11 缓存

一位AI开发者分享,通过引入强化学习和合成数据,提高了他们的语音模型的准确性和推理速度,并计划开源该项目。

0 人收藏 0 人点赞
#synthetic-data

@kadirnardev: 从现在开始,我将专注于加速 LFM2.5-Audio-1.5B 模型。我还将致力于强化学习方法和合成数据…

X AI KOLs Following ↗ · 2026-09-11 缓存

开发者宣布计划加速 LFM2.5-Audio-1.5B 模型,采用强化学习方法和合成数据,重点关注英语,并分享了 Mimi 编解码器模型的优化,以提升开源发布的速度和质量。

0 人收藏 0 人点赞
#synthetic-data

递归语言模型训练的脆弱性光谱

arXiv cs.CL ↗ · 2026-09-11 缓存

本文探讨了不同AI模型检查点在共享模型生成数据上进行递归训练时,对崩溃的易感性差异,揭示脆弱性是一种可通过短期迭代推断的内在属性。

0 人收藏 0 人点赞
#synthetic-data

微软几乎完全通过强化学习训练了一个40亿参数的编码代理,无需更大的教师模型

Reddit r/ArtificialInteligence ↗ · 2026-09-10 缓存

Microsoft Research 推出了 FrogNano,这是一个40亿参数的编码代理,完全通过强化学习进行训练,并使用在线任务合成,实现了有竞争力的性能,无需从更大模型中蒸馏。

0 人收藏 0 人点赞
#synthetic-data

MedDeID 实现了基于真实或合成训练数据的本地化临床文本去标识化

arXiv cs.CL ↗ · 2026-09-10 缓存

MedDeID 是一个本地部署的框架,用于使用真实或合成训练数据对临床文本进行去标识化,在检测个人身份信息方面实现了高准确率,同时最小化过度编辑。

0 人收藏 0 人点赞
#synthetic-data

SpatialBlock: 通过合成堆叠方块问题增强LVLMs中的空间智能

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

本文介绍了SpatialBlock-15k,这是一个针对堆叠方块问题的合成数据集,旨在提升大型视觉语言模型中的3D空间推理能力,并展示了性能的改进和对现实世界任务的泛化能力。

0 人收藏 0 人点赞
#synthetic-data

跨合成数据生成器家族的可移植因果公平性

arXiv cs.LG ↗ · 2026-09-04 缓存

这篇论文展示了因果公平机制,特别是因果图上的边切割,能够跨各种合成数据生成器家族移植,包括GANs和扩散模型,对数据保真度和实用性影响极小。

0 人收藏 0 人点赞
#synthetic-data

Xiaomi-TabLDM: 表格基础模型技术报告

arXiv cs.AI ↗ · 2026-09-04 缓存

介绍了Xiaomi-TabLDM,一个表格基础模型,它利用合成数据和上下文学习实现卓越的预测精度,无需特定任务微调,并在多个基准测试中获得顶级排名。

0 人收藏 0 人点赞
#synthetic-data

合成语义监督用于小型Transformer中的对比代码表示学习:一项实证研究

arXiv cs.AI ↗ · 2026-09-04 缓存

本文通过实证研究了使用合成语义监督对小型Transformer中的代码嵌入进行对比预训练,结果显示相比基线有显著提升,并且与大型模型具有竞争力。

0 人收藏 0 人点赞
#synthetic-data

合成数据能将泰语OCR推向多远?

arXiv cs.CL ↗ · 2026-09-04 缓存

本文研究了使用合成数据来改进泰语OCR,从而开发了Wayu-Paxa-OCR-Zero,该模型在没有真实OCR标签的情况下实现了竞争性性能。

0 人收藏 0 人点赞
#synthetic-data

构建与评估基于合成语音的固定语音泰语TTS系统

arXiv cs.CL ↗ · 2026-09-04 缓存

本文提出了一种方法,使用更大模型的合成语音构建紧凑的固定语音泰语TTS系统,评估其性能,并介绍了一个用于设备端部署的82M参数模型。

0 人收藏 0 人点赞
#synthetic-data

一个用于评估和对齐大型语言模型问题澄清能力的三代理框架

arXiv cs.CL ↗ · 2026-09-03 缓存

本文提出一种三代理框架,用于评估与对齐大型语言模型的问题澄清能力,通过三个基于LLM的代理模拟并评估澄清对话。

0 人收藏 0 人点赞
#synthetic-data

关系基础模型中的上下文窗口限制

arXiv cs.LG ↗ · 2026-09-02 缓存

本文评估了关系基础模型在高基数数据上的表现,揭示了上下文窗口限制导致性能下降,而通过简单的预聚合步骤可以缓解。

0 人收藏 0 人点赞
#synthetic-data

用于大语言模型时序评估与知识更新的合成世界

arXiv cs.CL ↗ · 2026-09-02 缓存

论文提出了一种合成模拟框架和基准,用于评估和更新大语言模型中的知识,展示了比现有方法提高14.23%的效果。

0 人收藏 0 人点赞
#synthetic-data

@theworldlabs: 用于机器人模拟,Atlas仅从几张照片重建一个空间,并生成逼真的RGB和深度数据…

X AI KOLs Following ↗ · 2026-09-01 缓存

Atlas是一个工具,它从几张照片重建空间,并为机器人模拟生成逼真的RGB和深度数据,使机器人能够在更多样化的环境中进行训练和测试。

0 人收藏 0 人点赞
#synthetic-data

量化合成数据中的误差容忍度:原子级操作数与操作符扰动研究

arXiv cs.CL ↗ · 2026-09-01 缓存

本文介绍了ATOM,一个区分合成数据中操作数和操作符扰动的框架,表明操作符扰动对LLM性能至关重要,并提出了改进的过滤策略。

0 人收藏 0 人点赞
#synthetic-data

基于零数据自举的对话推荐系统实证研究

Hugging Face Daily Papers ↗ · 2026-08-28 缓存

本文实证研究了使用非对话信号生成的合成数据自举对话推荐系统,证明了在低资源环境下,其性能优于零样本和稀缺真实数据方法。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈