data-efficiency

标签

Cards List
#data-efficiency

当标签稀缺时:一种用于振动诊断的振荡状态空间模型

arXiv cs.LG ↗ · 3天前 缓存

DualRes是一种紧凑的振荡状态空间模型,用于从振动数据诊断机器故障,在标签有限的情况下实现了最先进的性能,并降低了计算需求,适用于边缘部署。

0 人收藏 0 人点赞
#data-efficiency

解锁不可解难题:教师引导的课程学习实现数据高效RLVR

arXiv cs.CL ↗ · 2026-09-15 缓存

本文介绍了一种教师引导的课程学习方法,用于强化学习与可验证奖励(RLVR),以高效训练语言模型处理初始不可解的数学问题,实现显著的数据效率并扩展推理边界。

0 人收藏 0 人点赞
#data-efficiency

一个频谱,两种资源:自回归预测中的数据-内存缩放

arXiv cs.LG ↗ · 2026-09-15 缓存

本文建立了一个理论框架,表明自回归预测中的数据和内存资源受单一预测能量频谱的支配,提供了一个联合缩放定律。

0 人收藏 0 人点赞
#data-efficiency

用于数据高效语言学习的结构先验

arXiv cs.CL ↗ · 2026-09-11 缓存

本文研究了从非语言数据进行结构迁移以提高语言建模的数据效率,发现虽然它减少了下一个标记预测损失,但并未可靠地增强下游语言性能。

0 人收藏 0 人点赞
#data-efficiency

DE-Venus:面向大型语言模型的数据高效RLVR框架

arXiv cs.LG ↗ · 2026-09-04 缓存

DE-Venus 是一个统一的框架,用于大型语言模型中的数据高效RLVR,在保持性能的同时降低标注和训练成本。

0 人收藏 0 人点赞
#data-efficiency

单义性的复仇:专门化神经元提升多层感知机的数据效率

arXiv cs.LG ↗ · 2026-08-26 缓存

论文表明,在具有聚类数据的回归问题中,多层感知机自然发展出单义性的专门化神经元,通过学习局部低维表示而非全局表示来提高数据效率。

0 人收藏 0 人点赞
#data-efficiency

The Download:儿童超越AI学习,及太空旅行代理

MIT Technology Review ↗ · 2026-08-24 缓存

本文突出了儿童在学习上超越AI模型的数据效率差距,探讨了缩小这一差距的研究,并涵盖了太空旅行中的新兴职业,以及其他科技发展,如AI数据中心的反对和人形机器人的记录。

0 人收藏 0 人点赞
#data-efficiency

儿童在语言学习上超越了人工智能——而我们仍然不知道原因

MIT Technology Review ↗ · 2026-08-24 缓存

儿童学习语言所需的数据远少于像LLMs这样的AI模型,理解这种数据效率差距可能导致更高效的AI系统和对人类认知的洞察。

0 人收藏 0 人点赞
#data-efficiency

一种用于数据高效 RL 对齐的宪法网格工具(C-Guard)

arXiv cs.CL ↗ · 2026-08-04 缓存

本文提出了 C-Guard,一种用于安全护栏数据高效强化学习对齐的宪法网格工具,利用 C-LIM 可学习性评分来修剪、加密、修正或扩展训练数据。它将过度拒绝从 22.4% 降低到 12.8%,并提高了数据效率。

0 人收藏 0 人点赞
#data-efficiency

ReliableTableQA:可靠性标注需要多少监督?

arXiv cs.LG ↗ · 2026-07-24 缓存

介绍 ReliableTableQA,一个用于训练大语言模型标注表格问答结果统计可靠性的框架,展示了小规模 SFT 数据集就足够,且 GRPO 仅在 SFT 训练不足时有帮助。

0 人收藏 0 人点赞
#data-efficiency

照亮统一多模态模型,实现自由形式交错图文生成

Hugging Face Daily Papers ↗ · 2026-06-29 缓存

ILLUME-X 是一个统一的自由形式交错图文生成多模态模型,具有改进的数据效率、稳定的训练以及名为 ILScore 的全面评估指标。它在风格迁移、图像分解和故事讲述等任务上优于之前的模型。

0 人收藏 0 人点赞
#data-efficiency

CLI-Universe:面向终端代理的可验证任务合成引擎

Hugging Face Daily Papers ↗ · 2026-06-22 缓存

CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。

0 人收藏 0 人点赞
#data-efficiency

离线偏好轨迹评估

arXiv cs.LG ↗ · 2026-06-17 缓存

本文提出了一种针对智能体系统的离线偏好轨迹评估方法,通过时间偏好而非二元成功指标来比较轨迹。研究表明,该方法将平局比例从约75%降低到35%,从而提升了跨多样化基准的区分能力和数据效率。

0 人收藏 0 人点赞
#data-efficiency

APEX:具有动态数据选择的自动提示工程专家

arXiv cs.CL ↗ · 2026-06-11 缓存

APEX 引入了一种用于自动提示优化的动态数据选择策略,将数据集分层划分为简单、困难和混合三个层级,以提高数据效率,在多个基准测试中相对于初始提示取得了显著的性能提升。

0 人收藏 0 人点赞
#data-efficiency

基于基础模型先验的主动学习:类别不平衡下的高效学习

arXiv cs.LG ↗ · 2026-06-09 缓存

本文提出了一种新颖的主动学习框架,利用基础模型先验来同时解决类别不平衡和标签噪声问题,在图像和文本领域相比基线方法节省了超过50%的标注成本。

0 人收藏 0 人点赞
#data-efficiency

基于表格基础模型的统一且数据高效的预测与健康管理

arXiv cs.LG ↗ · 2026-06-05 缓存

本文提出一个框架,将表格基础模型应用于工业时间序列的预测与健康管理,在多个PHM任务上展示了强大的性能和高效的数据利用率。

0 人收藏 0 人点赞
#data-efficiency

通过领域感知核集选择与表格基础模型实现数据高效的洪水深度预测

arXiv cs.LG ↗ · 2026-06-05 缓存

本文提出一种领域感知核集构建流程,使表格基础模型仅用0.7%的训练数据即可预测洪水深度,达到监督参考精度的98.5%,并支持跨流域迁移而无需重新训练。

0 人收藏 0 人点赞
#data-efficiency

[R] 测量对称性--数据交换速率

Reddit r/MachineLearning ↗ · 2026-06-04 缓存

本文实证测量了等变性理论预测的对称性与数据交换速率,发现错误群对称约束具有实际危害,测试时轨道平均的数据增强与等变架构相匹配,而理论上 |G| 倍的样本复杂度降低仅得到弱证实,且置信区间较宽。该研究明确为探索性,未预先注册。

0 人收藏 0 人点赞
#data-efficiency

用于统一且数据高效的图像到图像翻译的解耦残差去噪扩散模型

Hugging Face Daily Papers ↗ · 2026-05-31 缓存

本文提出了用于统一且数据高效的图像到图像翻译的解耦残差去噪扩散模型(DRDD),将用于域协调的噪声扩散与用于语义映射的残差扩散解耦。

0 人收藏 0 人点赞
#data-efficiency

更少数据,更快训练:重复小数据集通过采样偏差加速学习

arXiv cs.LG ↗ · 2026-05-21 缓存

本文研究了“小规模与大规模差距”,即与使用更大的数据集相比,在更少的样本上进行更多次重复训练可以带来更快的学习和计算节省,并将加速归因于采样偏差所实现的逐层增长。研究结果表明,带有重复的小数据集可以被主动利用作为有利的归纳偏置,尤其是在推理任务中。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈