@rohanpaul_ai:Google DeepMind新论文。模型权重不必再是只能微调或平均化的静态工件……

X AI KOLs Following 论文

摘要

谷歌DeepMind的新论文SkillSmith将前缀键值缓存视为一种输入模态,在推理时把文本知识与现有权重组合成冻结的Gemma 3 4B模型的新前缀缓存,从而无需针对特定目标的训练运行即可改进适应能力。

Google DeepMind新论文。 模型权重不必再是只能被微调或平均化的静态工件。 现在,新能力可以从智能体写下的内容以及它先前学习并编码进权重的知识这两方面进行初始化。 SkillSmith将前缀键值缓存视为另一种输入模态。 对于新任务,它将现有的前缀权重与任务描述、示例以及说明源能力与目标关系的理由交织组合。 随后一次前向传播就会为冻结的Gemma 3 4B模型生成新的前缀缓存,因此初始组合发生在推理时,而不是通过新一轮针对特定目标的训练。 最清晰的证据来自消融实验:在Composite-SNI上,仅使用K-V缓存的Elo为1,455,仅使用文本为1,622,两者都用则为1,714。 这种收益无法仅用更丰富的提示或学习到的权重合并器来解释。 生成的前缀还为下游微调提供了更强的起点,尤其是在困难且数据稀疏的MMLU-ProX任务上。 边界很重要:在更简单的SNI任务上(每个约1,000个示例),微调方法会收敛。 SkillSmith并没有消除训练,而是改变了适应的起点:先前的文本和先前的权重现在可以被组合成新能力的初始化。 – arxiv.org/abs/2607.27497 标题:“SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge”
查看原文
查看缓存全文

缓存时间: 2026/08/03 03:34

谷歌 DeepMind 新论文。

模型权重不必是只能被微调或平均的静态工件。

现在,一种新能力可以从智能体写下的内容以及它先前学入权重的知识两者初始化。

SkillSmith 将前缀键值缓存视为另一种输入模态。

对于新任务,它将现有前缀权重与任务描述、示例以及解释源能力与目标之间关联的理由交错组合。

随后,一次前向传播为冻结的 Gemma 3 4B 模型生成新的前缀缓存,因此初始组合发生在推理时,而不是通过针对目标的新训练运行。

最清晰的证据来自消融实验:在 Composite-SNI 上,仅用 K-V 缓存时 Elo 为 1,455,仅用文本时为 1,622,两者都用时为 1,714。

这种增益无法仅用更丰富的提示或学到的权重合并来解释。

生成的前缀还为下游微调提供了更强的起点,尤其是在困难且数据稀疏的 MMLU-ProX 任务上。

边界很重要:在更简单的 SNI 任务上(每个约 1,000 个示例),微调方法趋于收敛。

SkillSmith 并没有消除训练,但它改变了适应(adaptation)的起始点:先前的文本和先前的权重现在可以被组合成新能力的初始化。

– arxiv. org/abs/2607.27497

标题:“SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge”

相似文章

google/gemma-4-31B-it-assistant

Hugging Face Models Trending

Google DeepMind 发布了 Gemma 4,这是一个开源权重的多模态模型家族,支持文本、图像、视频和音频,具备增强的推理和编码能力,并通过多令牌预测(MTP)实现高达 2 倍的解码速度提升。