DeepSeek-V4-Flash 让 LLM 引导再次变得有趣
摘要
文章探讨了 DeepSeek-V4-Flash 这一强大的本地模型如何使 LLM 引导再次变得实用,并讨论了 antirez 在 DwarfStar 4 项目中的概念及其实现。
暂无内容
查看缓存全文
缓存时间: 2026/05/16 15:40
# DeepSeek-V4-Flash 意味着大模型引导再次变得有趣
来源:https://www.seangoedecke.com/steering-vectors/
自从[金门大桥克劳德](https://www.anthropic.com/news/golden-gate-claude)问世以来,我一直对“引导”这件事着迷:即通过直接操控模型在推理过程中的激活值来引导LLM输出的想法。
### DeepSeek V4 Flash
我写这篇文章的灵感来自 antirez 最近的项目 [DwarfStar 4](https://github.com/antirez/ds4/tree/main),它是 [llama.cpp](https://github.com/ggml-org/llama.cpp) 的一个精简版本,专门用于运行 DeepSeek-V4-Flash。这个模型有什么特别之处?它可能正是许多工程师一直在等待的:一个本地模型,足以与至少低端前沿模型的智能编码能力竞争。
由于引导需要本地模型,现在许多工程师可以首次实际尝试了。事实上,antirez 已经将[引导功能](https://github.com/antirez/ds4/tree/main/dir-steering)作为一等公民整合到了 DwarfStar 4 中。目前它还很初级(基本上就是可以通过提示词复现的“简洁性”示例玩具),但初始发布才[八天前](https://github.com/antirez/ds4/commit/d997b56c151184bcff469dd8302ed97f23481024)。我打算密切关注这个项目。
### 引导的工作原理
引导的基本思路是从模型的内部大脑状态中提取一个概念(比如“简洁回应”),然后在推理过程中介入并增强构成该概念的数值激活。
一种做法是:将同一组一百个提示词两次输入模型,一次是普通提示词,另一次是在末尾加上“简洁回应”。然后测量每对提示词的模型激活差异(通过从一个激活矩阵中减去另一个)¹。这就是你的“引导向量”。理论上,你可以将其添加到任何提示词的同一激活层,并获得相同的效果(让模型简洁回应)。
另一种更复杂的方法是训练第二个模型,从你的模型的激活中提取“特征”:一些似乎会同时出现的行为模式。然后尝试将这些特征映射回单个概念,并以相同的方式增强它们。这大致就是 Anthropic 通过[稀疏自编码器](https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html)²在做的事情。原理与朴素方法相同,但能捕捉更深层的模式(代价是更耗费时间、算力和专业知识)。
### 引导为什么有趣
引导听起来像是一种作弊码。与其煞费苦心地组装一个训练集,试图将模型推向训练数据中“聪明”的那一端,为什么不直接找到模型大脑中的“聪明”旋钮,然后把它拧到最右呢?
它似乎也是一种调整模型说话方式的更优雅方法。与其摆弄提示词(加上或去掉“你必须”之类的限定语),我们能不能直接有一个像“简洁/啰嗦”或“谨慎/速度”这样的滑块控制面板,直接调整它们?
最后,它真的很酷。看着金门大桥克劳德[不情愿地把](https://www.anthropic.com/news/golden-gate-claude)每句话都扯回到金门大桥,就像奥利弗·萨克斯的神经学[轶事](https://en.wikipedia.org/wiki/The_Man_Who_Mistook_His_Wife_for_a_Hat)一样既迷人又让人不安。如果你自己的大脑也被以类似方式调整了,那还会是你吗?
### 为什么引导一直没被使用
那为什么我们不更多地使用引导呢?为什么ChatGPT和Claude Code还没有一个可以直接实时调整模型大脑的引导面板?一个原因是,在AI研究中,引导有点像一种“中层阶级”的想法。
它对大型AI实验室来说过于底层,它们可以直接操控模型,而不必在推理过程中进行尴尬的脑部手术。Anthropic也在研究这方面,但据我所知主要是从可解释性和安全性的角度。当他们想让模型以某种方式表现时,他们不会折腾引导,而是直接训练模型。
引导也超出了像你和我这样的普通AI用户³的触及范围——我们通过API使用LLM,因此无法访问模型权重或激活值来引导模型。例如,只有OpenAI才能为GPT-5.5识别或暴露引导向量。我们可以为开放权重模型做这件事,但直到最近(后面会详述),还没有足够强的开放模型值得这样做。
此外,大多数基本的引导应用都会被直接提示模型所超越。能够直接操控模型大脑听起来很厉害。但你猜还有什么东西可以直接操控模型大脑?提示词令牌。你可以通过引导对激活进行相当精细的控制,但通过调整提示词的语言,你已经可以进行极为精细的控制了。换句话说,费劲去引导模型变得更啰嗦,还不如直接“要求”它。
### 引导那些无法提示的概念
引导真正有用的一个方式,是如果我们能识别出无法通过提示词获得的概念。比如“智能”?以前你可以通过提示词来获得智能——这就是为什么4o时代提示词总是以“你是一个专家”开头——但当前一代模型已经将其内化为人设,所以提示词没用了。也许通过引导仍然有效?
最终这是一个经验问题,但我怀疑我们能否找到一个“智能”引导向量。换句话说,构成像“智能”这样复杂概念的引导向量,可能几乎与模型的整个权重集范围相同,因此识别它又归结为“训练一个智能模型”的问题。
一个足够复杂的引导方法最终只会取代实际模型。如果我拿GPT-2,并在每一层将其激活值替换为同一架构下更强模型的激活值,我会得到更好的结果。但那时你并不是让GPT-2更智能,而只是和更强的模型对话。智能在引导中,而不在模型中。更多内容请看我的文章《AI可解释性面临与心灵哲学相同的问题》。⁴
### 引导作为数据压缩
引导有用的另一种方式,是如果我们能引导一个需要大量令牌来表达的概念。这样引导就能为我们节省模型上下文窗口的一大块空间。直观上,我们可以将其视为把概念从模型的工作记忆移动到隐式记忆的一种方式。
例如,如果我们能识别出一个“对我特定代码库的了解”概念呢?当GPT-5.5快速阅读我的代码库时,它获得的一些知识一定埋藏在激活中,对吧?也许我们可以把它提取成一个非常大的引导向量。
我对此能否工作持怀疑态度。我认为我们会遇到与提取“智能”相同的问题:“了解我的代码库”这个概念可能足够复杂,需要对模型进行完整的微调⁴。但至少看起来是可能的。
### 结论
我对引导着迷,但并非特别乐观。我认为大部分收益可以通过提示词更高效地复制,而那些真正雄心勃勃的引导目标,通过训练或微调模型也可以更高效地实现。
然而,开源社区尚未在引导上投入大量工作,而现在可能正开始改变。如果我错了,引导确实有实际应用,我们应该在未来六个月内发现这一点。
看看像DwarfStar 4这样的定制模型工具是否会最终包含一个“可增强特征库”将很有趣。当一个流行的开放权重模型发布时,社区总是急于发布一系列包装器和量化版本。我们是否也会看到一股提取模型可增强特征的热潮?
以下是一个相关文章的预览,与本文共享标签。
---
[1] 通过从另一个矩阵中减去一个激活矩阵。
[2] 大致就是Anthropic通过稀疏自编码器所做的。
[3] 以及我们,使用API的用户。
[4] 见我的文章《AI可解释性面临与心灵哲学相同的问题》。
相似文章
DeepSeek V4 Flash 搭配 Antirez Dwarfstar 4 表现惊人
本文强调了在高内存Mac上使用DeepSeek V4 Flash搭配Antirez Dwarfstar 4的出色性能,指出其超越其他AI模型,并减少了对更大系统的需求。
Deepseek v4 Flash 确实惊艳,正准备入手一台 2.5 万美元的电脑
作者称赞 DeepSeek V4 Flash 实现了高性能的本地大语言模型部署,为此计划斥资 2.5 万美元采购硬件,以为对数据隐私要求严格的客户服务。
DeepSeek-V4 Flash 实际表现如何?
对 DeepSeek-V4 Flash 的性能和能力的评估,评估其实际有效性。
关于 DS4 的几句话
Antirez 宣布了 DwarfStar 4 (DS4),这是一个本地AI工具,它采用非对称 2/8 位量化,在高端消费级硬件上运行 DeepSeek v4 Flash,实现接近前沿的性能。他谈到了该项目的迅速流行、未来的模型更新和分布式推理计划,以及本地AI对严肃任务的重要性。
DeepSeek-V4-Flash-0731
DeepSeek 宣布推出 DeepSeek-V4-Flash-0731,这是一款以 Flash 级别定价提供先进能力的前沿智能体模型。