continued-pre-training

标签

Cards List
#continued-pre-training

@r_de_santi: 生成模型无法发现它们无法触及的东西。我们很高兴推出 ActFlow:一个持续预训练方案…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

本文介绍了 ActFlow,这是一种持续预训练方案,旨在扩展流模型和扩散模型的有效设计空间,从而实现分布外生成建模,并为科学发现提供可进化的搜索空间。

0 人收藏 0 人点赞
#continued-pre-training

教LLM低资源语言:提升Pharo中的代码补全

Hugging Face Daily Papers ↗ · 2026-07-06 缓存

本文介绍了一个端到端的管道,用于将LLM适配到低资源编程语言,以Pharo为案例研究,通过适合实时IDE支持的小型模型实现了卓越的代码补全。

0 人收藏 0 人点赞
#continued-pre-training

LLM持续预训练中最佳超参数的可预测缩放规律

arXiv cs.CL ↗ · 2026-06-05 缓存

本文发现了LLM持续预训练中最佳超参数(学习率、批量大小)的可预测缩放规律,提出了一个两阶段框架,可将超参数搜索开销降低高达90%,同时保持性能。

0 人收藏 0 人点赞
#continued-pre-training

冻结深层,训练浅层:持续预训练中可解释的层分配方法

arXiv cs.CL ↗ · 2026-05-13 缓存

本文提出了 LayerTracer,这是一个用于持续预训练中参数层分配的可解释框架。研究表明,在冻结深层网络的同时仅训练浅层,其效果优于全参数微调。这为资源受限团队优化大语言模型提供了一种低成本且可操作的策略。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈