data-efficiency

标签

Cards List
#data-efficiency

ReliableTableQA:可靠性标注需要多少监督?

arXiv cs.LG · 2026-07-24 缓存

介绍 ReliableTableQA,一个用于训练大语言模型标注表格问答结果统计可靠性的框架,展示了小规模 SFT 数据集就足够,且 GRPO 仅在 SFT 训练不足时有帮助。

0 人收藏 0 人点赞
#data-efficiency

照亮统一多模态模型,实现自由形式交错图文生成

Hugging Face Daily Papers · 2026-06-29 缓存

ILLUME-X 是一个统一的自由形式交错图文生成多模态模型,具有改进的数据效率、稳定的训练以及名为 ILScore 的全面评估指标。它在风格迁移、图像分解和故事讲述等任务上优于之前的模型。

0 人收藏 0 人点赞
#data-efficiency

CLI-Universe:面向终端代理的可验证任务合成引擎

Hugging Face Daily Papers · 2026-06-22 缓存

CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。

0 人收藏 0 人点赞
#data-efficiency

离线偏好轨迹评估

arXiv cs.LG · 2026-06-17 缓存

本文提出了一种针对智能体系统的离线偏好轨迹评估方法,通过时间偏好而非二元成功指标来比较轨迹。研究表明,该方法将平局比例从约75%降低到35%,从而提升了跨多样化基准的区分能力和数据效率。

0 人收藏 0 人点赞
#data-efficiency

APEX:具有动态数据选择的自动提示工程专家

arXiv cs.CL · 2026-06-11 缓存

APEX 引入了一种用于自动提示优化的动态数据选择策略,将数据集分层划分为简单、困难和混合三个层级,以提高数据效率,在多个基准测试中相对于初始提示取得了显著的性能提升。

0 人收藏 0 人点赞
#data-efficiency

基于基础模型先验的主动学习:类别不平衡下的高效学习

arXiv cs.LG · 2026-06-09 缓存

本文提出了一种新颖的主动学习框架,利用基础模型先验来同时解决类别不平衡和标签噪声问题,在图像和文本领域相比基线方法节省了超过50%的标注成本。

0 人收藏 0 人点赞
#data-efficiency

基于表格基础模型的统一且数据高效的预测与健康管理

arXiv cs.LG · 2026-06-05 缓存

本文提出一个框架,将表格基础模型应用于工业时间序列的预测与健康管理,在多个PHM任务上展示了强大的性能和高效的数据利用率。

0 人收藏 0 人点赞
#data-efficiency

通过领域感知核集选择与表格基础模型实现数据高效的洪水深度预测

arXiv cs.LG · 2026-06-05 缓存

本文提出一种领域感知核集构建流程,使表格基础模型仅用0.7%的训练数据即可预测洪水深度,达到监督参考精度的98.5%,并支持跨流域迁移而无需重新训练。

0 人收藏 0 人点赞
#data-efficiency

[R] 测量对称性--数据交换速率

Reddit r/MachineLearning · 2026-06-04 缓存

本文实证测量了等变性理论预测的对称性与数据交换速率,发现错误群对称约束具有实际危害,测试时轨道平均的数据增强与等变架构相匹配,而理论上 |G| 倍的样本复杂度降低仅得到弱证实,且置信区间较宽。该研究明确为探索性,未预先注册。

0 人收藏 0 人点赞
#data-efficiency

用于统一且数据高效的图像到图像翻译的解耦残差去噪扩散模型

Hugging Face Daily Papers · 2026-05-31 缓存

本文提出了用于统一且数据高效的图像到图像翻译的解耦残差去噪扩散模型(DRDD),将用于域协调的噪声扩散与用于语义映射的残差扩散解耦。

0 人收藏 0 人点赞
#data-efficiency

更少数据,更快训练:重复小数据集通过采样偏差加速学习

arXiv cs.LG · 2026-05-21 缓存

本文研究了“小规模与大规模差距”,即与使用更大的数据集相比,在更少的样本上进行更多次重复训练可以带来更快的学习和计算节省,并将加速归因于采样偏差所实现的逐层增长。研究结果表明,带有重复的小数据集可以被主动利用作为有利的归纳偏置,尤其是在推理任务中。

0 人收藏 0 人点赞
#data-efficiency

基于主动信息搜索的上下文训练

Hugging Face Daily Papers · 2026-05-13 缓存

本文介绍了一种上下文优化方法,该方法通过维基百科搜索和浏览器工具进行主动信息搜索,并结合基于搜索的训练流程,在无需更新模型权重的情况下,在多个领域实现了稳健的性能提升。

0 人收藏 0 人点赞
#data-efficiency

RoboEvolve:在有限数据下实现机器人操作的计划器与模拟器协同进化

Hugging Face Daily Papers · 2026-05-13 缓存

RoboEvolve是一个框架,它协同进化VLM规划器和VGM模拟器用于机器人操作,仅用500张无标签种子图像就实现了数据效率以及鲁棒的持续学习。

0 人收藏 0 人点赞
#data-efficiency

零样本世界模型是发展高效的学习者 [R]

Reddit r/MachineLearning · 2026-04-18

研究人员引入了零样本世界模型(Zero-shot World Models, ZWM),该方法在仅使用极少数据(单个幼儿的视觉经验)且无需特定任务训练的情况下,即可达到与最先进模型相当的视觉能力。这项工作展示了通往数据效率可与人类发展学习效率匹敌的AI系统的路径。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈