标签
Rogo Intelligence使用LLMs从多个数据源创建全面的实体档案,捕捉超出传统CRM的洞察,适用于投资公司。
本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
HSS-Synth 首次提出了面向人文与社会科学的数据合成流水线,生成了 237k 个高质量的指令微调样本,在 Qwen3-8B 上超越了基线并取得了新的 SOTA。
BridgeAlign 提出了一种面向人文与社会科学领域的偏好对齐流水线,生成了 21 万条合成偏好样本,使 Qwen3-8B 在 17 个基准测试上取得了强劲表现。
提出了一种基于GAN的框架(GT-GAN),用于从不完整的LEO卫星互联网观测中合成高保真数据,即使在40%数据缺失的情况下也表现出鲁棒性。
Infinity-Parser2 技术报告介绍了一个用于端到端文档解析的大型多模态模型,该模型具有可扩展的数据合成流水线及多任务强化学习能力。它在多项基准测试中取得了领先结果,同步发布了开源模型变体及一个包含500万样本的双语语料库。
本文介绍了Goku,一个百万规模的指令驱动视频编辑数据集与基准,支持多任务和结构性操作。配套的模型Goku-Edit在指令遵循方面比开源模型提升了高达8%。
本文介绍了RODS,一种奖励驱动的在线数据合成方法,该方法解决了多轮工具使用智能体训练中静态数据集信息样本耗尽的问题。它在显著减少轨迹数量的情况下,达到了与更大规模离线流水线相当的性能。
Edu-Theater是一种数据高效的智能体框架,利用基于LLM的生成式智能体模拟教育场景中的学习者行为。它采用了一种群体感知的点名范式,以更少的数据和计算资源推断学习者状态,实现了更高的模拟精度。
介绍了Geometry-Aware Tabular Diffusion(GATD),该方法通过显式的成对几何特征增强表格扩散去噪器。在十个基准测试上取得了最先进的性能,同时使用的参数显著更少。
DOMINO 是一个新颖的框架,它从参考示例中学习最小充分的领域表示,为LLMs合成领域特定数据,从而在不要求显式领域描述的情况下提升代码基准性能。
本文提出了一种知识感知的Text-to-SQL框架,利用知识蒸馏在低资源环境下通过构建任务特定的知识库并生成合成训练数据来提升性能。在七个基准上的实验表明,该方法带来了显著的改进,尤其是对于开源模型。
Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。
本文提出了一种专门用于可解释虚假信息检测的LLM微调流水线,并介绍了一种数据合成方法LonsRex,用于生成必要且充分的解释,解决了仅基于标签正确性进行简单过滤的局限性。
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
FrontierSmith 自动从封闭式任务中生成多样化的开放式编程问题,通过增强的智能体交互和训练数据合成,提升 LLM 在基准测试中的编码性能。
本文介绍了CUActSpot,一个用于评估计算机使用代理的多模态基准测试,以及一个基于渲染器的数据合成流程。提出的Phi-Ground-Any-4B模型在32B参数以下的开源模型中表现最佳。
CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。