Measuring Monosemanticity in Sparse Autoencoders via Latent Activation Coherence
Researchers introduced the Tversky Monosemanticity Score, a new metric for evaluating monosemanticity in Sparse Autoencoders to improve explainability without external labels.