data-augmentation

标签

Cards List
#data-augmentation

评估帧速率在基于序列的自闭症相关自我刺激手部特发性行为分类中的影响

arXiv cs.AI ↗ · 2026-07-10 缓存

本文评估了帧采样率对使用LSTM和GRU模型进行基于序列的自闭症相关自我刺激手部行为分类的影响,在15帧间隔下实现了高达98.75%的准确率,并分析了针对小规模行为视频数据集的数据增强策略。

0 人收藏 0 人点赞
#data-augmentation

生成更多数据何时更有帮助?——在合成数据扩展中区分固定源合成与源扩展

arXiv cs.CL ↗ · 2026-07-03 缓存

本文在合成数据扩展中区分了固定源合成(FSS)与源扩展,提出了一种修正的缩放定律,能够从低预算拟合预测高预算下的性能。实验结果表明,FSS 是有界的,并且在大规模下,增加种子问题比增加回答预算表现更好。

0 人收藏 0 人点赞
#data-augmentation

@neural_avb: 这与 text-albumentations 库的工作方式非常接近。输入文本来源,并生成面向任务的…

X AI KOLs Timeline ↗ · 2026-07-02 缓存

本文对比了 text-albumentations 库与新的 Autodata 论文,后者增加了带有弱/强解析器和外部评判器的审查机制,以维持合成数据集的质量。

0 人收藏 0 人点赞
#data-augmentation

AGVBench:面向可靠性的静脉识别数据增强基准测试

Hugging Face Daily Papers ↗ · 2026-07-02 缓存

AGVBench是一个面向可靠性的静脉识别数据增强基准测试,评估了多个数据集和骨干网络上的30种增强策略,揭示了准确性与安全性之间的解耦。

0 人收藏 0 人点赞
#data-augmentation

从SRA到Self-Flow:数据增强还是自监督?

Hugging Face Daily Papers ↗ · 2026-07-02 缓存

本文研究了扩散Transformer中自对齐方法的机制,揭示了Self-Flow等方法带来的性能提升主要来自噪声维度上的数据增强,而非噪声级别之间的token交互。作者引入Attention Separation来证明这一点,并提出了一种结合自表示对齐与双时间步增强的有效设计。

0 人收藏 0 人点赞
#data-augmentation

模型能力增强的数据与评估闭环

arXiv cs.AI ↗ · 2026-06-30 缓存

介绍了能力切片这一单元,用于将评估失败与LLM中的数据干预联系起来,实现诊断和修复模型弱点的闭环流程。通过两个案例研究进行演示,展示了从训练回归中恢复以及数学推理能力的显著提升。

0 人收藏 0 人点赞
#data-augmentation

如何利用合成语音构建基于LLM的ASR系统?

arXiv cs.CL ↗ · 2026-06-30 缓存

本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。

0 人收藏 0 人点赞
#data-augmentation

用于回归的反事实残差数据增强

arXiv cs.LG ↗ · 2026-06-30 缓存

提出了一种针对表格回归的反事实残差数据增强(CRDA)方法,利用特征扰动下残差不变性生成逼真的训练样本,在基准测试中实现了显著的均方误差(MSE)降低。

0 人收藏 0 人点赞
#data-augmentation

MirrorPPR:基于示例的人像照片修图

Hugging Face Daily Papers ↗ · 2026-06-28 缓存

MirrorPPR 提出了一种基于示例的人像修图框架,采用带有 LoRA 适应的扩散变换器和自增强训练数据,实现了卓越的质量和身份保持。

0 人收藏 0 人点赞
#data-augmentation

\textsc{DiARC}: 区分正负样本有助于提升大语言模型的类ARC推理能力

arXiv cs.CL ↗ · 2026-06-26 缓存

DiARC是一种方法,通过从正负样本构建偏好对来提升大语言模型在类ARC任务上的推理能力,在多个基准测试中优于基线模型。

0 人收藏 0 人点赞
#data-augmentation

贝叶斯神经网络的等变性和数据增强

arXiv cs.LG ↗ · 2026-06-26 缓存

本文研究了使用变分推断训练的贝叶斯神经网络的数据增强方法,推导了精确等变性的条件,并引入了新颖的对称化技术(如轨道扩展)以提升对称性和性能。

0 人收藏 0 人点赞
#data-augmentation

从科学论文中提取问题和方法句子:使用公式化表达脱敏的上下文增强Transformer

arXiv cs.CL ↗ · 2026-06-26 缓存

本文提出了一种使用公式化表达脱敏的上下文增强Transformer,用于从科学论文中提取问题和方法句子,在两个数据集上分别实现了3.71%和2.67%的宏F1分数提升。

0 人收藏 0 人点赞
#data-augmentation

数据增强:傅里叶分析视角

arXiv cs.LG ↗ · 2026-06-24 缓存

本文开发了一个傅里叶分析框架,用于研究群不变性下的数据增强,表明部分增强可以在近似误差趋近于零的情况下实现与完全增强相同的极小极大速率,同时还证明了精确不变性需要全群平均。

0 人收藏 0 人点赞
#data-augmentation

揭秘数据受限语言模型预训练中的训练时数据增强

Hugging Face Daily Papers ↗ · 2026-06-19 缓存

本文研究了在数据受限、算力充足的场景下,为缓解自回归语言模型预训练中的过拟合而采用训练时数据增强技术,发现结合词元级噪声、序列排列和目标偏移预测可以改善验证损失。

0 人收藏 0 人点赞
#data-augmentation

基于迁移学习与数据增强的低资源汉语方言辨识

arXiv cs.CL ↗ · 2026-06-18 缓存

本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。

0 人收藏 0 人点赞
#data-augmentation

想要更好的合成数据?引导它:用于低资源语言生成的激活引导

arXiv cs.CL ↗ · 2026-06-18 缓存

本文研究了激活引导作为替代少样本提示的方法,用于生成低资源语言的合成数据。作者提出了LanguageSteering和QualitySteering策略,表明在早期层进行引导可以提高数据多样性并改善下游模型性能。

0 人收藏 0 人点赞
#data-augmentation

REVES: REVES:修订与验证增强的测试时扩展训练

Hugging Face Daily Papers ↗ · 2026-06-17 缓存

提出REVES,一种两阶段迭代框架,交替进行数据增强与策略优化,通过利用中间修正步骤提升LLM推理能力,在编程基准测试和约束满足问题上取得更优性能。

0 人收藏 0 人点赞
#data-augmentation

CoCoGEC:用于鲁棒语法错误纠正的反事实生成

arXiv cs.CL ↗ · 2026-06-16 缓存

提出CoCoGEC,一种反事实生成框架,通过改变GEC训练数据中与错误无关的上下文来提升模型鲁棒性,在扰动基准上取得了显著的F0.5提升。

0 人收藏 0 人点赞
#data-augmentation

PiDA: 基于语音信息的数据增强方法以实现鲁棒的越南语语音翻译

arXiv cs.CL ↗ · 2026-06-12 缓存

本文提出PiDA,一种基于语音信息的越南语语音翻译数据增强方法,通过使用语音词嵌入生成类似ASR的破坏来提高鲁棒性,在噪声输出上获得高达+2.04 BLEU的提升。

0 人收藏 0 人点赞
#data-augmentation

一次越狱,多种语言:学习语言不敏感的意图表示用于多语言越狱检测

arXiv cs.CL ↗ · 2026-06-11 缓存

本文提出MLJailDe,一个多语言越狱检测框架,利用反向翻译数据增强和相对距离约束来提高跨语言泛化能力和鲁棒性,在11种语言上实现了98.5%的F1分数。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈