toy-models

Tag

Cards List
#toy-models

Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models

arXiv cs.LG · 2026-07-30 Cached

This paper studies transferring lessons about supervised fine-tuning (SFT) across alignment training, model organisms, and toy models, showing that techniques like training on reasons for behavior and mixing on-model data can improve generalization and capability preservation.

0 favorites 0 likes
#toy-models

@TamazGadaev: day 10/n (series on fundamental texts for AI researchers - not specific papers so much as pieces that hand you a lens f…

X AI KOLs Timeline · 2026-07-14 Cached

Toy Models of Superposition by Elhage et al. explains why interpretability is hard: models represent more features than dimensions via superposition, leading to polysemantic neurons as compression. This paper spawned the sparse autoencoder research program.

0 favorites 0 likes
← Back to home

Submit Feedback