prefix-tuning

标签

Cards List
#prefix-tuning

@omarsar0:谷歌DeepMind的新研究。(收藏它)SkillSmith将模型权重视为LLM可原生读取的额外模态……

X AI KOLs Following · 2026-08-02 缓存

谷歌DeepMind推出SkillSmith,将模型权重视为LLM可以原生推理的额外模态,从而实现指令引导的参数化合成,在推理时组合技能。该方法优于仅文本和仅权重的基线方法。

0 人收藏 0 人点赞
#prefix-tuning

SkillSmith:学习组合参数化技能与文本知识

arXiv cs.CL · 2026-07-31 缓存

本文介绍了SkillSmith,这是一种增强型LLM,能够对前缀权重和文本知识进行推理,从而实现指令引导的新参数化技能合成,其性能优于仅文本和仅权重的基线方法。

0 人收藏 0 人点赞
#prefix-tuning

最大化GRPO信号:针对困难推理问题的自适应轨迹前缀控制

arXiv cs.CL · 2026-07-09 缓存

本文介绍了AdaPrefix-GRPO,一种在GRPO训练期间自适应控制提供给模型的正确解决方案前缀长度的方法,保持50%的成功率以最大化梯度信号。它在显著提高困难数学推理问题准确率的同时降低了计算成本。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈