activation-engineering

标签

Cards List
#activation-engineering

基于属性的激活引导:为LLMs实现针对特定群体的解释生成

arXiv cs.CL · 6天前 缓存

本文提出基于属性的激活引导方法,旨在为特定群体定制LLM解释,与提示和最先进基线相比,实现了更好的具体性和事实性。

0 人收藏 0 人点赞
#activation-engineering

定位与控制大型语言模型中的隐式个性化

arXiv cs.CL · 2026-08-13 缓存

本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。

0 人收藏 0 人点赞
#activation-engineering

潜在事实核查:通过激活工程检测错误信息

arXiv cs.LG · 2026-08-10 缓存

本文介绍了一种基于激活工程的错误信息检测框架,将最后一个token的激活投影到LLM残差流中学习到的“虚假方向”上。研究在Gemma、Llama和Qwen模型上进行了事实核查基准评估,表明真实性在潜在空间中是线性可分的。

0 人收藏 0 人点赞
#activation-engineering

通过激活聚合的提示压缩

arXiv cs.CL · 2026-07-10 缓存

本文提出通过中间层激活的学习加权和将指令提示压缩为单个激活向量,准确率下降低于2%,并揭示了对LLM激活空间结构的洞察。

0 人收藏 0 人点赞
#activation-engineering

UniSteer:文本引导的激活空间流匹配实现多功能大语言模型操控

Hugging Face Daily Papers · 2026-05-28 缓存

UniSteer 提出了一种文本引导的激活流匹配方法,在激活空间中学习通用条件速度场,无需特定任务干预模块即可实现多功能的 LLM 行为控制与分类任务。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈