pre-training

标签

Cards List
#pre-training

符号图预训练与提示学习

arXiv cs.LG ↗ · 2天前 缓存

本文介绍了TopoSIGN,一个针对符号图的拓扑引导的图预训练和提示学习框架,它结合了结构编码和持久同调,以改善链路预测和节点分类等任务中的迁移学习。

0 人收藏 0 人点赞
#pre-training

超曲面约束动态权重更新实验 [P]

Reddit r/MachineLearning ↗ · 6天前

一个实验性的语言模型架构使用超曲面进行动态权重更新以减少训练参数,仅使用16%的参数即可实现比未展开基线更好的性能。该方法在FineWeb-Edu数据集上进行了测试,并包含一个GitHub实现。

0 人收藏 0 人点赞
#pre-training

@iamtrask: AI归属比你想象的要好。推理用Shapley,后训练用LoRA,预训练用层次结构……

X AI KOLs Timeline ↗ · 2026-09-19 缓存

该推文讨论了有效的AI归属方法:推理中使用Shapley值,后训练中使用LoRA,预训练中使用层次方法,并提出了路由通用智能的未来。

0 人收藏 0 人点赞
#pre-training

AutoData: 预训练数据选择的智能体搜索

arXiv cs.AI ↗ · 2026-09-18 缓存

AutoData 引入了一个AI智能体,通过搜索可执行算法来自动化大型语言模型的预训练数据选择,超越了人工设计的筛选流程,并提升了下游指标。

1 人收藏 1 人点赞
#pre-training

QVAC Genesis III: 一个大规模、高质量的开放合成 STEM 语料库,用于高效语言模型预训练

arXiv cs.AI ↗ · 2026-09-18 缓存

QVAC Genesis III 是一个开源的合成 STEM 语料库,旨在提升语言模型预训练的效率,与先前的数据集相比,在基准测试中表现出显著改进。

0 人收藏 0 人点赞
#pre-training

尼泊尔法律专长通过生成式和抽取式预训练变压器(NepLEGiT)

arXiv cs.CL ↗ · 2026-09-16 缓存

本文介绍了NepLEGiT,一种专门在尼泊尔法律文本上从头预训练的小型语言模型,旨在提升尼泊尔法律知识的可及性和服务交付。

0 人收藏 0 人点赞
#pre-training

POSPAN: 位置约束跨度掩码用于语言模型预训练

arXiv cs.LG ↗ · 2026-09-16 缓存

POSPAN 引入了一个位置约束的跨度掩码框架,统一了现有的跨度级别方法用于语言模型预训练,在 NLU 基准测试中显示出增强的性能。

0 人收藏 0 人点赞
#pre-training

并非所有否定线索都相等:附缀式否定带来更好的否定理解

arXiv cs.CL ↗ · 2026-09-15 缓存

本文介绍了NegCue,一个大规模否定数据集,并展示了在语言模型中,使用附缀式否定进行预训练相比单词否定能带来更好的否定理解提升。

0 人收藏 0 人点赞
#pre-training

Osprey:目标无关的预训练让推测解码中的草稿模型更强大

arXiv cs.CL ↗ · 2026-09-10 缓存

Osprey引入了一种针对推测解码中草稿模型的目标无关预训练方法,通过从现成模型中引导并适应最少的特定目标工作来提高效率,在多个大语言模型上实现了显著的接受率提升。

0 人收藏 0 人点赞
#pre-training

LLaDA-Image: 构建强大图像生成器的完全开放训练方案

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。

0 人收藏 0 人点赞
#pre-training

方言税:方言偏见在语言建模流程中的持续存在

arXiv cs.CL ↗ · 2026-08-27 缓存

本文研究了方言偏见如何在整个语言建模流程中持续存在和累积,从分词到推理,表明差异在每一步都被编码。

0 人收藏 0 人点赞
#pre-training

让视频模型学得更好、更快

Hacker News Top ↗ · 2026-08-27 缓存

本文探讨了生成式视频预训练中数据筛选技术的演进,重点介绍了利用计算机视觉、大语言模型和强化学习等方法,通过高质量数据提升模型性能。

0 人收藏 0 人点赞
#pre-training

Granite 4.2 LLMs:构建原理

Hugging Face Blog ↗ · 2026-08-25 缓存

Granite 4.2是IBM推出的新型推理LLM系列,提供3B、8B和30B尺寸,具备思考模式、工具调用功能,并在Apache 2.0许可证下通过多阶段强化学习流水线进行训练。

0 人收藏 0 人点赞
#pre-training

LAION-BVD:用于多模态预训练的千万小时开放视频数据集

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

LAION-BVD是一个大规模开放视频数据集,包含1000万小时的视频数据,用于多模态预训练,具有合成字幕和竞争力的基准性能。

0 人收藏 0 人点赞
#pre-training

我刚刚从零开始构建了一个迷你版Kimi-K3,花费不到250美元!已经击败了GPT-2(124M)!

Reddit r/LocalLLaMA ↗ · 2026-08-20

一位研究人员以不到250美元构建了一个拥有10.2亿参数的迷你版Kimi-K3模型,其HellaSwag得分达到33.4%,超过了GPT-2的28%得分。

0 人收藏 0 人点赞
#pre-training

AntLing 已开源 6 个基础模型检查点,涵盖预训练、中期训练和 WSM 合并阶段,适用于 Ling-3.0-tiny 和 Ling-3.0-flash。

Reddit r/LocalLLaMA ↗ · 2026-08-19

AntLing 已为 Ling-3.0-tiny 和 Ling-3.0-flash 开源六个基础模型检查点,涵盖预训练、中期训练和 WSM 合并阶段,为研究人员提供灵活的起点,并突出 WSM 和共享训练配方。

0 人收藏 0 人点赞
#pre-training

何时复习:用于语言模型持续预训练的间隔重复

arXiv cs.AI ↗ · 2026-08-19 缓存

本文介绍了间隔重复训练(SRT),一种用于语言模型持续预训练的框架,它使用受认知科学启发的自适应复习调度来缓解灾难性遗忘。它改善了稳定性-可塑性权衡,增强了旧知识的保留同时获取新信息。

0 人收藏 0 人点赞
#pre-training

凭借对物理的感知,AI模型能模拟更广泛的现实世界场景

MIT News — Artificial Intelligence ↗ · 2026-08-10 缓存

MIT CSAIL和清华大学的研究人员提出了GeoPT,这是一种预训练方法,利用合成动力学帮助AI模型更高效地学习物理,以模拟车辆安全和机器人测试等现实世界场景。其达到峰值性能的速度提升两倍,训练所需数据最多减少60%。

0 人收藏 0 人点赞
#pre-training

@heyshrutimishra:这就是机器人技术以惊人速度扩展的方式。超过一百万小时的人们日常任务数据。完全没有机器人数据。……

X AI KOLs Timeline ↗ · 2026-08-10 缓存

Dyna Robotics 推出了 Dyna-2,一个在超过一百万小时人类视频上预训练的世界动作模型,发现了机器人操作的新扩展定律。

0 人收藏 0 人点赞
#pre-training

探索Claude/GPT的知识截止日期与预训练时间线

Hacker News Top ↗ · 2026-08-10 缓存

一篇博客文章,探讨如何通过精心设计的问题来探查前沿AI模型,从而推断其预训练数据和时间线中隐藏的细节,包括对模型参数和训练检查点的估算。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈