concept-discovery

Tag

Cards List
#concept-discovery

Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent

arXiv cs.LG · 2026-07-21 Cached

HARP is a training-free interpretability method that uses an LLM agent with a vector database of activations and tools for manipulation, outperforming training-based methods on concept discovery, detection, steering, and secret elicitation.

0 favorites 0 likes
← Back to home

Submit Feedback