synthetic-data

标签

Cards List
#synthetic-data

利用可控合成对话训练智能语音助手唤醒系统

arXiv cs.AI ↗ · 2天前 缓存

本文介绍了一种用于虚拟助手的智能唤醒系统,该系统采用上下文触发检测和合成对话数据以改善自然交互。作者公开了代码、数据集和训练好的模型,以促进研究可重复性。

0 人收藏 0 人点赞
#synthetic-data

A Synthetic Multivariate Refrigerator Time-Series Dataset for Predictive Maintenance

arXiv cs.LG ↗ · 4天前 缓存

本文介绍了一个用于冰箱预测性维护的合成多变量时间序列数据集,该数据集通过物理启发式模拟器生成,旨在支持故障预测与退化分析。

0 人收藏 0 人点赞
#synthetic-data

基于纵向结构化EHR的有来源依据的合成笔记生成多智能体管道

arXiv cs.CL ↗ · 4天前 缓存

本文提出了MedNotes,一个多智能体管道,用于从纵向结构化EHR数据中生成有来源依据的合成临床笔记,实现了高准确性并改善了下游临床建模任务。

0 人收藏 0 人点赞
#synthetic-data

超越缝合假设:通过语义量化的多模态合成数据评估统一框架

arXiv cs.CL ↗ · 4天前 缓存

本文提出了一种使用语义量化和跨模态指标评估多模态合成数据的统一框架,强调了进行显式评估时需要排列基线和覆盖报告。

0 人收藏 0 人点赞
#synthetic-data

@rohanpaul_ai:一个4B编程代理在未使用前沿模型蒸馏的情况下,通过结合更简单的工具接口,在SWE-bench Verified上达到61.5%。

X AI KOLs Timeline ↗ · 5天前 缓存

FrogNano 是一个4B编程代理,通过在线任务合成训练,在SWE-bench Verified上达到61.5%的成绩,使用简化的工具接口和自适应合成任务。

0 人收藏 0 人点赞
#synthetic-data

一体化多语言场景文本识别:基于脚本感知的混合专家模型

Hugging Face Daily Papers ↗ · 6天前 缓存

本文介绍了ScriptMoE,一种用于一体化多语言场景文本识别的脚本感知混合专家架构,以及TextMuSS-10M合成数据集,在基准测试中取得了最先进的准确率。

0 人收藏 0 人点赞
#synthetic-data

EdgeGen: 通过合成边缘案例生成提升工具调用智能体超越理想路径

Hugging Face Daily Papers ↗ · 6天前 缓存

EdgeGen 是一个合成任务生成框架,它创建基于数据库的边缘案例任务,以通过微调和 harness 优化来改进工具调用智能体,展示了一致的性能提升。

0 人收藏 0 人点赞
#synthetic-data

一个基于Qwen3.5 4B微调的Jev风格模型

Reddit r/LocalLLaMA ↗ · 6天前

作者使用LoRA对Qwen3.5 4B进行了微调,结合公开数据和合成数据创建了一个Jev风格模型,实现了性能提升,并开源了模型和数据集。

0 人收藏 0 人点赞
#synthetic-data

AI安全对话已变得难以置信

TechCrunch AI ↗ · 2026-09-19 缓存

本文讨论了关于AI安全的病毒式传播对话,重点提及Andrew Yang关于AI污染网络的言论,以及Noam Brown关于低估AI能力和气隙系统潜在突破风险的警告。

0 人收藏 0 人点赞
#synthetic-data

QVAC Genesis III: 一个大规模、高质量的开放合成 STEM 语料库,用于高效语言模型预训练

arXiv cs.AI ↗ · 2026-09-18 缓存

QVAC Genesis III 是一个开源的合成 STEM 语料库,旨在提升语言模型预训练的效率,与先前的数据集相比,在基准测试中表现出显著改进。

0 人收藏 0 人点赞
#synthetic-data

Andrew Yang表示,一名AI实验室负责人昨日告诉他,OpenAI的群体智能代理用“可自我复制并创建机器人网络的代码”污染了互联网,导致这些实验室现在“不得不创建人工合成网络来训练他们的机器人。”

Reddit r/ArtificialInteligence ↗ · 2026-09-17

Andrew Yang称,一名AI实验室负责人告知他,OpenAI的群体智能代理以可自我复制的代码污染了互联网,迫使实验室开发用于训练的人工合成网络。

0 人收藏 0 人点赞
#synthetic-data

总部位于冰岛的语音模拟平台公司Treble完成1800万美元融资

TechCrunch AI ↗ · 2026-09-17 缓存

冰岛初创公司Treble已完成1800万美元融资,以推进其语音模拟平台在AI模型训练、硬件测试和合成数据生成方面的应用,客户包括亚马逊和罗技等企业。

0 人收藏 0 人点赞
#synthetic-data

社会模式在合成数据中是否成立?分析LLM生成与真实对话中的网络欺凌动态

arXiv cs.CL ↗ · 2026-09-17 缓存

本文评估LLM生成的网络欺凌对话是否忠实地再现了真实互动的社会动态,发现虽然高级结构得以保留,但更细粒度的细节以模型依赖的方式系统性地扭曲。

0 人收藏 0 人点赞
#synthetic-data

Datamimic – 不要让你的编码代理创建自己的测试环境

Hacker News Top ↗ · 2026-09-16 缓存

DATAMIMIC 是一款开源工具,专为确定性合成数据生成和PII感知假名化设计,面向受监管企业,其企业版提供额外的治理和工作流功能。

0 人收藏 0 人点赞
#synthetic-data

通过专家指导生成有效上下文特定基准的框架

arXiv cs.AI ↗ · 2026-09-16 缓存

本文提出了一种利用专家指导和合成数据生成上下文特定大语言模型基准数据集的框架,提高了有效性和可扩展性,优于现有方法。

0 人收藏 0 人点赞
#synthetic-data

Style-Debiased DPO:使用事实感知合成偏好数据更新大型语言模型知识

arXiv cs.CL ↗ · 2026-09-16 缓存

本文提出了Style-Debiased DPO (SD-DPO),一种用于事实感知合成偏好数据的方法,旨在改善大型语言模型中的知识提取,解决标准DPO可能因风格差异而错误惩罚正确回答的问题。

0 人收藏 0 人点赞
#synthetic-data

高效推理蒸馏:通过合成思维链与难度感知微调的小型视频语言模型

arXiv cs.LG ↗ · 2026-09-16 缓存

本文提出了一种方法,利用合成的思维链理由和难度感知微调,将推理能力蒸馏到紧凑的视频语言模型中,使较小的模型能够在最小的计算开销下超越较大的模型。

0 人收藏 0 人点赞
#synthetic-data

LLMs作为伪造大师:为制造业生成合成时间序列数据

arXiv cs.LG ↗ · 2026-09-16 缓存

一种新颖的框架,利用LLMs生成制造业合成时间序列数据,在异常检测等下游任务中显示出优于传统建模技术的性能提升。

0 人收藏 0 人点赞
#synthetic-data

TimeThink:激发时间序列大型语言模型中的组合推理

arXiv cs.AI ↗ · 2026-09-15 缓存

TimeThink 引入了一个合成框架,通过带有可验证奖励的强化学习来增强时间序列大型语言模型中的组合推理,在合成和真实任务上显示出相对于基线的显著改进。

0 人收藏 0 人点赞
#synthetic-data

FINESSE: 一个用于多模态金融事件序列的基于代理的模拟器和基准数据集

arXiv cs.LG ↗ · 2026-09-14 缓存

FINESSE是一个基于代理的模拟框架和基准数据集,用于生成合成的多模态金融事件序列,解决数据稀缺问题,并支持欺诈检测和余额预测等任务。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈