标签
FINESSE是一个基于代理的模拟框架和基准数据集,用于生成合成的多模态金融事件序列,解决数据稀缺问题,并支持欺诈检测和余额预测等任务。
ToolGrad 介绍了一种使用文本梯度生成工具使用数据集的高效方法,以更低的成本实现更好的大语言模型训练,并提升在分布外任务上的性能。
本文介绍了一个无需真实数据集即可生成一致虚构企业数据的生成器,采用无参考评估方法确保数据真实性,并提供了一个托管服务,用于根据业务问题构建关系数据库。
本文研究了在多模型生态系统中,当AI生成的文本被回收用于训练数据时发生的模型崩溃。研究发现,市场集中度对崩溃的速度或终点几乎没有影响,这主要受训练数据源的影响。
一位AI开发者分享,通过引入强化学习和合成数据,提高了他们的语音模型的准确性和推理速度,并计划开源该项目。
开发者宣布计划加速 LFM2.5-Audio-1.5B 模型,采用强化学习方法和合成数据,重点关注英语,并分享了 Mimi 编解码器模型的优化,以提升开源发布的速度和质量。
本文探讨了不同AI模型检查点在共享模型生成数据上进行递归训练时,对崩溃的易感性差异,揭示脆弱性是一种可通过短期迭代推断的内在属性。
Microsoft Research 推出了 FrogNano,这是一个40亿参数的编码代理,完全通过强化学习进行训练,并使用在线任务合成,实现了有竞争力的性能,无需从更大模型中蒸馏。
MedDeID 是一个本地部署的框架,用于使用真实或合成训练数据对临床文本进行去标识化,在检测个人身份信息方面实现了高准确率,同时最小化过度编辑。
本文介绍了SpatialBlock-15k,这是一个针对堆叠方块问题的合成数据集,旨在提升大型视觉语言模型中的3D空间推理能力,并展示了性能的改进和对现实世界任务的泛化能力。
这篇论文展示了因果公平机制,特别是因果图上的边切割,能够跨各种合成数据生成器家族移植,包括GANs和扩散模型,对数据保真度和实用性影响极小。
介绍了Xiaomi-TabLDM,一个表格基础模型,它利用合成数据和上下文学习实现卓越的预测精度,无需特定任务微调,并在多个基准测试中获得顶级排名。
本文通过实证研究了使用合成语义监督对小型Transformer中的代码嵌入进行对比预训练,结果显示相比基线有显著提升,并且与大型模型具有竞争力。
本文研究了使用合成数据来改进泰语OCR,从而开发了Wayu-Paxa-OCR-Zero,该模型在没有真实OCR标签的情况下实现了竞争性性能。
本文提出了一种方法,使用更大模型的合成语音构建紧凑的固定语音泰语TTS系统,评估其性能,并介绍了一个用于设备端部署的82M参数模型。
本文提出一种三代理框架,用于评估与对齐大型语言模型的问题澄清能力,通过三个基于LLM的代理模拟并评估澄清对话。
论文提出了一种合成模拟框架和基准,用于评估和更新大语言模型中的知识,展示了比现有方法提高14.23%的效果。
Atlas是一个工具,它从几张照片重建空间,并为机器人模拟生成逼真的RGB和深度数据,使机器人能够在更多样化的环境中进行训练和测试。
本文介绍了ATOM,一个区分合成数据中操作数和操作符扰动的框架,表明操作符扰动对LLM性能至关重要,并提出了改进的过滤策略。