llm-finetuning

标签

Cards List
#llm-finetuning

Matryoshka归因:学习将语言模型输出归因到表示和权重

arXiv cs.CL ↗ · 5天前 缓存

论文介绍了Matryoshka Attribution(MAttr),一种用于将语言模型输出归因到内部组件的掩码学习方法,在Mechanistic Interpretability Benchmark上取得了顶尖性能,并展示了通过调整权重来修改大语言模型行为的实际应用。

0 人收藏 0 人点赞
#llm-finetuning

SP3O:无需奖励建模的基于片段偏好的强化学习

arXiv cs.LG ↗ · 2026-08-05 缓存

介绍SP3O,一种新颖的无需奖励模型、无需评论家的基于梯度的偏好强化学习算法,利用片段级偏好,在机器人控制和LLM微调中展现出改进的性能,尤其是在长时程任务中。

0 人收藏 0 人点赞
#llm-finetuning

卡尔曼与课程学习相遇:自适应RL微调的高效动态提示选择

arXiv cs.LG ↗ · 2026-07-31 缓存

本文介绍了KGPS,一种卡尔曼引导的提示选择方法,用于大语言模型的自适应强化学习微调。该方法将提示难度建模为动态状态,以提高准确率和采样效率。

0 人收藏 0 人点赞
#llm-finetuning

FoRA: Fisher正交秩适应实现参数高效微调

arXiv cs.CL ↗ · 2026-05-29 缓存

FoRA提出了一种参数高效微调方法,通过Fisher评分选择任务相关层,并在Stiefel流形上训练LoRA下投影,在保持精度的同时减少参数。

0 人收藏 0 人点赞
#llm-finetuning

@Suryanshti777: NVIDIA刚刚揭秘了它们用来让LLM微调显著加速的隐藏技巧。不是新GPU。不是大…

X AI KOLs Timeline ↗ · 2026-05-07

NVIDIA和Unsloth发布了一篇技术指南,详细介绍了三种底层优化方法,可将LLM微调速度提升高达25%,包括打包序列缓存、双缓冲检查点存储和优化的MoE路由。该指南提供了深入的系统级解释和基准测试,面向机器学习工程师和开发者。

0 人收藏 0 人点赞
#llm-finetuning

CBRS:基于双语数据集与双层过滤的多平台社交流认知血液请求系统

arXiv cs.CL ↗ · 2026-04-21 缓存

孟加拉国工程技术大学的研究人员提出了CBRS,一个多平台框架,采用双层架构并利用包含1.1万条孟加拉语和英语双语解析血液请求消息的新数据集,对社交媒体中的血液捐赠请求进行过滤和解析。其LoRA微调的Llama-3.2-3B模型实现了99%的过滤准确率和92%的零样本解析准确率,在减少35倍令牌使用量的同时,优于GPT-4o-mini等其他大语言模型。

0 人收藏 0 人点赞
#llm-finetuning

基于价值梯度流的强化学习

Hugging Face Daily Papers ↗ · 2026-04-15 缓存

价值梯度流(VGF)提出了一种可扩展的行为正则化强化学习方法,将其构建为通过离散梯度流求解的最优传输问题,在离线强化学习和大型语言模型强化学习基准测试中取得了最先进的成果。该方法消除了显式的策略参数化,同时通过控制传输预算实现了自适应的测试时缩放。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈