data-augmentation

标签

Cards List
#data-augmentation

BabyLMs的通心粉训练:代码切换课程导致跨语言融合

arXiv cs.CL ↗ · 2天前 缓存

本文探讨在数据限制下使用代码切换文本来对齐小型语言模型的表征,表明涉及代码切换的课程能提升多语言性能。

0 人收藏 0 人点赞
#data-augmentation

从上下文中学习:基于扰动公共文档的合成训练

Hugging Face Daily Papers ↗ · 3天前 缓存

本文介绍了一种合成训练管道,利用扰动公共文档生成上下文相关的训练数据,显著提升了大型语言模型在诸如CL-bench等上下文学习任务上的性能,且无需人工标注。

0 人收藏 0 人点赞
#data-augmentation

基于角色感知 Morgan Fingerprints 的反应产率预测

arXiv cs.LG ↗ · 2026-09-22 缓存

本文提出 MFP,一种使用角色感知 Morgan fingerprints 预测化学反应产率的方法,与现有方法如 YieldBERT 和 GNAN 相比,实现了高准确度和更快的训练。

0 人收藏 0 人点赞
#data-augmentation

REPAIR:通过事实验证迭代改进解决科学检索器中的长尾混淆

arXiv cs.AI ↗ · 2026-09-17 缓存

REPAIR是一种自演化的数据增强框架,用于科学稠密检索器,通过事实验证迭代改进解决长尾混淆,在材料科学和生物医学基准测试中展示了显著的性能提升。

0 人收藏 0 人点赞
#data-augmentation

用于资源受限人类活动识别的覆盖感知虚拟IMU增强

arXiv cs.AI ↗ · 2026-09-16 缓存

本文提出了一种覆盖感知的虚拟IMU增强框架,以解决人类活动识别中的数据稀缺问题,通过生成和选择合成传感器数据来提高有限标注数据下的模型性能。

0 人收藏 0 人点赞
#data-augmentation

探索扩散变压器在多模态脑状态解码中的跨模态增强

arXiv cs.AI ↗ · 2026-09-12 缓存

本文提出了CoMA-DiT,一种用于多模态脑状态解码中潜在增强的双向跨模态扩散变压器,它通过将配对模态用作相互监督信号来增强听觉注意力解码和情感识别等任务的性能。

0 人收藏 0 人点赞
#data-augmentation

KItCAT:基于输入损坏的自回归训练知识注入方法

arXiv cs.CL ↗ · 2026-09-02 缓存

KItCAT 介绍了一种轻量级的自回归大型语言模型训练策略,该策略通过输入损坏生成多样化的训练输入,无需昂贵的改写即可改善从专业文档的知识注入。

0 人收藏 0 人点赞
#data-augmentation

更多正确数据何时有害?插入稳定性与维度理论的局限性

arXiv cs.LG ↗ · 2026-08-17 缓存

本文研究了添加正确标注数据可能损害模型性能的场景,引入了插入稳定性概念,并探讨了维度理论在机器学习泛化中的局限性。

0 人收藏 0 人点赞
#data-augmentation

LLM生成样本的几何过滤在少样本文本分类中的应用

arXiv cs.CL ↗ · 2026-08-17 缓存

本文提出了一种几何过滤框架,通过评估LLM生成样本在嵌入空间中与真实类别示例的欧氏距离来选择高质量样本,从而将少样本文本分类性能提升了2.61个百分点,优于SMOTE方法。

0 人收藏 0 人点赞
#data-augmentation

基于仿真的车辆交通数据增强:通过虚拟传感扩展传感器覆盖范围

arXiv cs.AI ↗ · 2026-08-17 缓存

本文提出一种基于仿真的方法,用虚拟传感器替代物理传感器来生成增强交通数据集,从而在保持交通模式的同时扩展城市网络中的传感器覆盖范围。

0 人收藏 0 人点赞
#data-augmentation

针对第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

arXiv cs.CL ↗ · 2026-08-17 缓存

本文介绍了第二届MLC-SLM挑战赛的技术,包括随机前置静音裁剪和合成数据生成,以提升多语言对话语音任务,实现了准确率提升和错误率降低。

0 人收藏 0 人点赞
#data-augmentation

自监督视觉在线策略蒸馏

Hugging Face Daily Papers ↗ · 2026-08-14 缓存

本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。

0 人收藏 0 人点赞
#data-augmentation

TailBooster:一种面向极端值增强且强制执行运行有效性的双层生成框架

Hugging Face Daily Papers ↗ · 2026-08-12 缓存

TailBooster是一种双层生成框架,通过统计尾部提取和基于自编码器的清洗来合成运行上有效的极端航空运输事件,显著提高了极端事件预测的准确性。

0 人收藏 0 人点赞
#data-augmentation

评估用于野火后泥石流预测的机器学习模型

arXiv cs.LG ↗ · 2026-08-07 缓存

本文使用美国地质调查局(USGS)流域尺度数据,系统评估了包括TabPFN基础模型在内的15种机器学习模型在野火后泥石流预测中的表现,发现TabPFN取得了最佳性能(威胁评分为0.637),并且合成数据增强能改善大多数模型的性能。

0 人收藏 0 人点赞
#data-augmentation

使用GMM和LLM通过定向数据增强进行不平衡数据聚类

arXiv cs.CL ↗ · 2026-08-03 缓存

本文提出了一种新颖的无监督数据增强方法,结合高斯混合模型和大语言模型,通过为代表性不足的聚类生成合成文档,改善不平衡文本数据集上的聚类效果。

0 人收藏 0 人点赞
#data-augmentation

一种基于GAN的卫星互联网观测数据鲁棒合成框架

arXiv cs.AI ↗ · 2026-07-29 缓存

提出了一种基于GAN的框架(GT-GAN),用于从不完整的LEO卫星互联网观测中合成高保真数据,即使在40%数据缺失的情况下也表现出鲁棒性。

0 人收藏 0 人点赞
#data-augmentation

thaulab@EEUCA 2026: 谁对谁说了什么?一种目标感知的神经符号流水线用于游戏毒性检测

arXiv cs.CL ↗ · 2026-07-24 缓存

本文提出了一种三阶段神经符号流水线用于游戏毒性检测,结合了Transformer集成与基于规则的调解,在EEUCA 2026共享任务中取得了最高准确率。

0 人收藏 0 人点赞
#data-augmentation

翻译作为数据增强:翻译数据对难度评估的影响

arXiv cs.CL ↗ · 2026-07-22 缓存

本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。

0 人收藏 0 人点赞
#data-augmentation

K-IPO:面向不平衡表格数据的肯德尔约束重要性保持过采样方法

arXiv cs.LG ↗ · 2026-07-21 缓存

提出了K-IPO,一种先生成后选择的过采样框架,在增强不平衡表格数据时保留原始数据的特征重要性排序(以肯德尔τ系数衡量),在20个数据集上展现出更优的重要性保持、解释一致性和预测性能。

0 人收藏 0 人点赞
#data-augmentation

一种将2D设计高效转化为3D模型以实现快速原型制作的更好方法

MIT News — Artificial Intelligence ↗ · 2026-07-16 缓存

MIT等机构的研究人员开发了GIFT系统,该系统教导视觉-语言模型自动将2D设计转换为精确的CAD程序,用于快速原型制作,通过使用模型生成的数据来纠正错误,并以更少的计算量提升性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈