标签
本文介绍了一种数据中心化的流水线,用于通过挖掘推理轨迹、蒸馏指令数据和生成可验证的问答对来对语言模型进行后训练,以增强金融推理能力,展示了在防止灾难性遗忘的同时性能得到提升。
本文介绍了持久发现上下文,这是一个为数据智能体设计的轻量级记忆层,用于存储先前的意图到对象的映射,以增强跨任务的检索质量,在结构化数据环境中展示了改进。
介绍了 Data-Centric Parallel (DCP),一种通过在每批次动态调整运行时设置来训练变长序列深度学习模型的方法,在 32 个 H200 GPU 上实现了高达 2.88 倍的加速,仅需集成 10 行代码。
本文提出了DataRx,一种缺失感知的采样方法,用于在任务特定微调期间选择安全关键的示例以保持大语言模型的安全性,在Llama3-8B-Instruct上将攻击成功率从59.23%降低到13.70%。
本文介绍了DMAPO,一种偏好优化方法,利用多评估者共识来选取高置信度的在策略响应,以显著更少的数据(仅3.45%的接受率)实现强对齐,并在多个基准测试中优于SimPO等基线。
WeightsLab 是一个开源、PyTorch 原生的工具,允许团队在训练过程中暂停、检查实时损失信号,并在数据问题(如标签错误和类别不平衡)影响模型性能之前发现它们。它专为处理图像、视频和 LiDAR 点云的计算机视觉工程师而设计。
本文提出了PreUnlearn,一个在LLM遗忘执行前审计附带知识损害的框架,采用以数据为中心的分析来预测跨语义层的下游损害。
本文介绍了LIMMT,这是一项以数据为中心的研究,表明使用高质量、极小的运动数据子集(不到AMASS的3%)进行训练,在基于物理的人形动作追踪方面优于使用完整数据集,并通过物理可行性、多样性和复杂性来定义运动数据质量。
本综述将大型语言模型的对齐微调重新表述为一个数据流水线设计问题,将其分解为三个环节:响应合成、偏好评估和偏好实例化。它识别了设计权衡和失败模式,并概述了开放挑战,如提示级对齐和智能体设置。
本文挑战了代码能提升语言模型推理能力的观点,通过受控的预训练实验发现,代码主要提升编程能力,而推理能力的提升来自结构化推理轨迹(如代码-文本混合和数学-文本混合)。
本文介绍了EMA,一种面向学习型系统的模型自适应系统,能够在降低训练和标注成本的同时,提升系统在不断演化环境中的性能。
DataFlex是一个面向大语言模型数据驱动动态训练的统一框架,集成了样本选择、领域混合调整和样本重加权,兼容标准工作流程并支持高效大规模部署,相比静态训练实现了一致的性能提升。