@rohanpaul_ai:Google DeepMind新论文。模型权重不必再是只能微调或平均化的静态工件……
摘要
谷歌DeepMind的新论文SkillSmith将前缀键值缓存视为一种输入模态,在推理时把文本知识与现有权重组合成冻结的Gemma 3 4B模型的新前缀缓存,从而无需针对特定目标的训练运行即可改进适应能力。
查看缓存全文
缓存时间: 2026/08/03 03:34
谷歌 DeepMind 新论文。
模型权重不必是只能被微调或平均的静态工件。
现在,一种新能力可以从智能体写下的内容以及它先前学入权重的知识两者初始化。
SkillSmith 将前缀键值缓存视为另一种输入模态。
对于新任务,它将现有前缀权重与任务描述、示例以及解释源能力与目标之间关联的理由交错组合。
随后,一次前向传播为冻结的 Gemma 3 4B 模型生成新的前缀缓存,因此初始组合发生在推理时,而不是通过针对目标的新训练运行。
最清晰的证据来自消融实验:在 Composite-SNI 上,仅用 K-V 缓存时 Elo 为 1,455,仅用文本时为 1,622,两者都用时为 1,714。
这种增益无法仅用更丰富的提示或学到的权重合并来解释。
生成的前缀还为下游微调提供了更强的起点,尤其是在困难且数据稀疏的 MMLU-ProX 任务上。
边界很重要:在更简单的 SNI 任务上(每个约 1,000 个示例),微调方法趋于收敛。
SkillSmith 并没有消除训练,但它改变了适应(adaptation)的起始点:先前的文本和先前的权重现在可以被组合成新能力的初始化。
– arxiv. org/abs/2607.27497
标题:“SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge”
相似文章
@omarsar0:谷歌DeepMind的新研究。(收藏它)SkillSmith将模型权重视为LLM可原生读取的额外模态……
谷歌DeepMind推出SkillSmith,将模型权重视为LLM可以原生推理的额外模态,从而实现指令引导的参数化合成,在推理时组合技能。该方法优于仅文本和仅权重的基线方法。
@omarsar0:来自 Google DeepMind 及其同事的重磅论文。(收藏它)一个模型在每次生成时读取其整个 KV 缓存……
这篇论文介绍了声明式注意力,一种允许语言模型声明其在思维链中关注位置的协议,在 Gemma-4-31B 上减少 52% 的关注令牌,在 Qwen-3.6-27B 上减少 31.1%,精度损失最小。
google/gemma-4-31B-it-assistant
Google DeepMind 发布了 Gemma 4,这是一个开源权重的多模态模型家族,支持文本、图像、视频和音频,具备增强的推理和编码能力,并通过多令牌预测(MTP)实现高达 2 倍的解码速度提升。
@mtschannen:过去几年,我的研究重点是跨模态统一模型与训练范式。今天我很激动……
谷歌DeepMind研究员宣布发布Gemma 4 12B,一种无编码器的密集模型,可处理文本、图像和音频输入,延续了跨模态统一模型的研究工作。
Gemma 4:同等参数规模下能力最强的开源模型
Google DeepMind 发布 Gemma 4,这是其迄今为止能力最强的开源模型系列,专为高级推理和智能体工作流设计,在多种参数规模下均实现了极高的智能密度。