activation-analysis

Tag

Cards List
#activation-analysis

Alignment via Training Against Probes Without Losing Monitorability

arXiv cs.LG ↗ · 3d ago Cached

The paper studies probe-guided fine-tuning, using probes that detect undesired properties in model activations as a direct training signal for alignment. Continuously updated probes substantially reduce harmfulness and improve honesty while preserving utility, achieving better safety-utility trade-offs than DPO and inference-time steering, and remaining robust to jailbreak and abliteration attacks without losing monitorability.

0 favorites 0 likes
#activation-analysis

Causal and Interpretable Structures in LLM Compositional Tasks

arXiv cs.CL ↗ · 5d ago Cached

研究利用功能ANOVA分解,揭示了LLM在组合任务中跨层的因果与几何表示机制:中间层使用两token联合关系表示,后期层转向三token联合表示,且限制模型仅关注因果相关表示反而提升了下一token预测准确率。

0 favorites 0 likes
#activation-analysis

Measuring Maximum Activations in Open Large Language Models

arXiv cs.CL ↗ · 2026-05-18 Cached

This paper measures maximum activation magnitudes across 27 checkpoints from 8 open LLM families, finding significant variance across families, architectures, and training stages, with implications for low-bit quantization and deployment.

0 favorites 0 likes
← Back to home

Submit Feedback