Forecasting Side Effects of Activation Steering
Di cosa parla
Si studia una tecnica che modifica il comportamento di un modello linguistico intervenendo su come elabora internamente le informazioni per indurlo a rispondere in modo voluto; questa manipolazione può però causare effetti collaterali su altre funzioni. Viene mappato come una modifica influisce su vari comportamenti e si scopre che gli effetti collaterali sono frequenti, strutturati e non spiegabili con semplici euristiche. Nonostante la complessità, tali ricadute risultano in gran parte prevedibili prima dell'intervento: la loro entità dipende dal comportamento bersaglio, mentre la direzione può essere stimata dalle rappresentazioni del modello non modificato con maggiore precisione rispetto a metodi elementari.
Cosa permette di osservare
Permette di esplorare se e come sia possibile prevedere prima di intervenire gli effetti indesiderati sui modelli, e quali segnali interni del modello possano aiutare a valutare e pianificare interventi più sicuri.
Dalla fonte
Activation steering modifies a language model by adding a learned direction to its hidden activations, enabling targeted behavioral changes without retraining. While effective, steering often produces unintended side effects on other behaviors, making it difficult to deploy safely. We therefore ask: can these side effects be forecasted before steering is applied? We answer this question by constructing a cross-effect matrix over a taxonomy of 67 behaviors across three open-weight language models. We find that side effects are common, structured, and often asymmetric, revealing interactions that cannot be explained by existing similarity-based heuristics. Despite this complexity, we show that side effects are largely predictable before steering is performed. Their magnitude depends primarily on the target behavior, while their direction can be forecasted from the model's unsteered repres…