标签
本文探讨在数据限制下使用代码切换文本来对齐小型语言模型的表征,表明涉及代码切换的课程能提升多语言性能。
本文介绍了一种合成训练管道,利用扰动公共文档生成上下文相关的训练数据,显著提升了大型语言模型在诸如CL-bench等上下文学习任务上的性能,且无需人工标注。
本文提出 MFP,一种使用角色感知 Morgan fingerprints 预测化学反应产率的方法,与现有方法如 YieldBERT 和 GNAN 相比,实现了高准确度和更快的训练。
REPAIR是一种自演化的数据增强框架,用于科学稠密检索器,通过事实验证迭代改进解决长尾混淆,在材料科学和生物医学基准测试中展示了显著的性能提升。
本文提出了一种覆盖感知的虚拟IMU增强框架,以解决人类活动识别中的数据稀缺问题,通过生成和选择合成传感器数据来提高有限标注数据下的模型性能。
本文提出了CoMA-DiT,一种用于多模态脑状态解码中潜在增强的双向跨模态扩散变压器,它通过将配对模态用作相互监督信号来增强听觉注意力解码和情感识别等任务的性能。
KItCAT 介绍了一种轻量级的自回归大型语言模型训练策略,该策略通过输入损坏生成多样化的训练输入,无需昂贵的改写即可改善从专业文档的知识注入。
本文研究了添加正确标注数据可能损害模型性能的场景,引入了插入稳定性概念,并探讨了维度理论在机器学习泛化中的局限性。
本文提出了一种几何过滤框架,通过评估LLM生成样本在嵌入空间中与真实类别示例的欧氏距离来选择高质量样本,从而将少样本文本分类性能提升了2.61个百分点,优于SMOTE方法。
本文提出一种基于仿真的方法,用虚拟传感器替代物理传感器来生成增强交通数据集,从而在保持交通模式的同时扩展城市网络中的传感器覆盖范围。
本文介绍了第二届MLC-SLM挑战赛的技术,包括随机前置静音裁剪和合成数据生成,以提升多语言对话语音任务,实现了准确率提升和错误率降低。
本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。
TailBooster是一种双层生成框架,通过统计尾部提取和基于自编码器的清洗来合成运行上有效的极端航空运输事件,显著提高了极端事件预测的准确性。
本文使用美国地质调查局(USGS)流域尺度数据,系统评估了包括TabPFN基础模型在内的15种机器学习模型在野火后泥石流预测中的表现,发现TabPFN取得了最佳性能(威胁评分为0.637),并且合成数据增强能改善大多数模型的性能。
本文提出了一种新颖的无监督数据增强方法,结合高斯混合模型和大语言模型,通过为代表性不足的聚类生成合成文档,改善不平衡文本数据集上的聚类效果。
提出了一种基于GAN的框架(GT-GAN),用于从不完整的LEO卫星互联网观测中合成高保真数据,即使在40%数据缺失的情况下也表现出鲁棒性。
本文提出了一种三阶段神经符号流水线用于游戏毒性检测,结合了Transformer集成与基于规则的调解,在EEUCA 2026共享任务中取得了最高准确率。
本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。
提出了K-IPO,一种先生成后选择的过采样框架,在增强不平衡表格数据时保留原始数据的特征重要性排序(以肯德尔τ系数衡量),在20个数据集上展现出更优的重要性保持、解释一致性和预测性能。
MIT等机构的研究人员开发了GIFT系统,该系统教导视觉-语言模型自动将2D设计转换为精确的CAD程序,用于快速原型制作,通过使用模型生成的数据来纠正错误,并以更少的计算量提升性能。