activation-manipulation

标签

Cards List
#activation-manipulation

检索即足够:使用工具代理的无训练可解释性

arXiv cs.LG · 2026-07-21 缓存

HARP 是一种无需训练的可解释性方法,它利用配备激活向量数据库及操作工具的 LLM 代理,在概念发现、概念检测、模型引导和秘密抽取方面优于基于训练的方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈