FEGA, a pipeline for analyzing how sparse autoencoder features causally affect language-model behavior and representation geometry. - View it on GitHub
Star
3
Rank
3458747