AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Locating and Controlling Implicit Personalization in Large Language Models

Di cosa parla

Si studia come i grandi modelli di linguaggio cambiano risposta quando percepiscono indizi demografici impliciti e se questo comportamento si può individuare e controllare dentro il modello. Con conversazioni corrispondenti su più modelli trovano un segnale localizzato nelle attivazioni interne — i cambiamenti che avvengono dentro il modello mentre elabora il testo — la cui rimozione può attenuare l'influenza degli indizi più efficacemente di semplici istruzioni, pur mantenendo le prestazioni generali. La possibilità di agire in modo selettivo però varia molto a seconda del modello e dell'attributo.

Cosa permette di osservare

Permette di esplorare se è possibile monitorare e intervenire sul modo in cui i modelli personalizzano le risposte in base a indizi demografici e quali limiti esistono nella selettività del controllo tra diversi modelli e caratteristiche.

hardwaremodelli linguisticiregolamentazionericerca

Dalla fonte

Large language models (LLMs) often shift their outputs in response to implicit demographic cues even when users never state a demographic identity. Previous work has documented this behavior, but the connection between these behavioral changes and the model's internal activations remains unclear. Using matched cued and neutral conversations across five LLMs, we establish that a localized internal activation signal tracks changes in recommendations, with correlations up to r=0.87. When multiple cues appear together, their internal signals largely combine, but the changes in output do not simply add up. We further show that removing the internal signal associated with one cue can suppress its influence, often more effectively than asking the model to ignore demographics via prompting, while largely preserving general benchmark performance. However, the ability to selectively remove one di…