标签
本文介绍了TopoSIGN,一个针对符号图的拓扑引导的图预训练和提示学习框架,它结合了结构编码和持久同调,以改善链路预测和节点分类等任务中的迁移学习。
一个实验性的语言模型架构使用超曲面进行动态权重更新以减少训练参数,仅使用16%的参数即可实现比未展开基线更好的性能。该方法在FineWeb-Edu数据集上进行了测试,并包含一个GitHub实现。
该推文讨论了有效的AI归属方法:推理中使用Shapley值,后训练中使用LoRA,预训练中使用层次方法,并提出了路由通用智能的未来。
AutoData 引入了一个AI智能体,通过搜索可执行算法来自动化大型语言模型的预训练数据选择,超越了人工设计的筛选流程,并提升了下游指标。
QVAC Genesis III 是一个开源的合成 STEM 语料库,旨在提升语言模型预训练的效率,与先前的数据集相比,在基准测试中表现出显著改进。
本文介绍了NepLEGiT,一种专门在尼泊尔法律文本上从头预训练的小型语言模型,旨在提升尼泊尔法律知识的可及性和服务交付。
POSPAN 引入了一个位置约束的跨度掩码框架,统一了现有的跨度级别方法用于语言模型预训练,在 NLU 基准测试中显示出增强的性能。
本文介绍了NegCue,一个大规模否定数据集,并展示了在语言模型中,使用附缀式否定进行预训练相比单词否定能带来更好的否定理解提升。
Osprey引入了一种针对推测解码中草稿模型的目标无关预训练方法,通过从现成模型中引导并适应最少的特定目标工作来提高效率,在多个大语言模型上实现了显著的接受率提升。
LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。
本文探讨了生成式视频预训练中数据筛选技术的演进,重点介绍了利用计算机视觉、大语言模型和强化学习等方法,通过高质量数据提升模型性能。
Granite 4.2是IBM推出的新型推理LLM系列,提供3B、8B和30B尺寸,具备思考模式、工具调用功能,并在Apache 2.0许可证下通过多阶段强化学习流水线进行训练。
LAION-BVD是一个大规模开放视频数据集,包含1000万小时的视频数据,用于多模态预训练,具有合成字幕和竞争力的基准性能。
一位研究人员以不到250美元构建了一个拥有10.2亿参数的迷你版Kimi-K3模型,其HellaSwag得分达到33.4%,超过了GPT-2的28%得分。
AntLing 已为 Ling-3.0-tiny 和 Ling-3.0-flash 开源六个基础模型检查点,涵盖预训练、中期训练和 WSM 合并阶段,为研究人员提供灵活的起点,并突出 WSM 和共享训练配方。
本文介绍了间隔重复训练(SRT),一种用于语言模型持续预训练的框架,它使用受认知科学启发的自适应复习调度来缓解灾难性遗忘。它改善了稳定性-可塑性权衡,增强了旧知识的保留同时获取新信息。
MIT CSAIL和清华大学的研究人员提出了GeoPT,这是一种预训练方法,利用合成动力学帮助AI模型更高效地学习物理,以模拟车辆安全和机器人测试等现实世界场景。其达到峰值性能的速度提升两倍,训练所需数据最多减少60%。
Dyna Robotics 推出了 Dyna-2,一个在超过一百万小时人类视频上预训练的世界动作模型,发现了机器人操作的新扩展定律。
一篇博客文章,探讨如何通过精心设计的问题来探查前沿AI模型,从而推断其预训练数据和时间线中隐藏的细节,包括对模型参数和训练检查点的估算。