Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning
Di cosa parla
Propongono un controllo per verificare se un grande modello linguistico ha davvero "dimenticato" certe informazioni: misura quanto concetti mirati restano accessibili osservando come segnali interni si collegano alle parole prodotte. Testando centinaia di modelli trattati con vari metodi, trovano che molti conservano tracce interne, che questa accessibilità predice la velocità di ripresa a livello di modello ma non quali fatti torneranno, e che minimizzarla porta il modello a nascondere le tracce invece di cancellarle.
Cosa permette di osservare
Mostra se gli audit interni possono prevedere la ripresa di conoscenze cancellate e se usarli come obiettivo porta il modello a nascondere le tracce, sembrando dimenticare quando in realtà conserva la conoscenza.
Dalla fonte
Prior white-box studies show that large language models can retain latent traces of target knowledge after unlearning, even when the knowledge is no longer expressed in their outputs. However, existing audits remain limited to one-off diagnostics: it is unclear whether these residual signals can predict future recovery under continued training or serve as reliable optimization targets. Resolving this gap is essential to determine whether internal auditing can move beyond post-hoc evaluation toward proactive risk monitoring and safer unlearning. We propose J-Access, an inference-time audit that uses the Jacobian lens to map intermediate representations into vocabulary space and measures how often target concepts remain accessible along the model's output pathway. We hypothesize that residual accessibility reflects recovery susceptibility: knowledge that remains closer to the output pathw…