activation-dispersion

Tag

Cards List
#activation-dispersion

Does Bielik Know What It Doesn't Know? Activation Dispersion Separates Entity Familiarity from Factual Reliability Across Model Scale

arXiv cs.CL · 2026-07-09 Cached

This paper investigates whether activation patterns in Polish Bielik LLMs can detect entity familiarity before generation, using unsupervised dispersion measures that achieve near-perfect separation of known vs. fabricated entities across model scales, while showing that factual reliability improves sharply with scale but is harder to predict from activations.

0 favorites 0 likes
← Back to home

Submit Feedback