Identifying Interactions at Scale for LLMs
Di cosa parla
Si cerca di scoprire quali combinazioni di elementi — parti del testo, esempi usati per addestrare il modello o componenti interni — spingono un grande modello di linguaggio a dare una certa risposta. Per farlo si misurano gli effetti di «rimuovere» pezzi e si presentano due metodi, SPEX e ProxySPEX, che identificano le interazioni davvero influenti con molti meno esperimenti sfruttando l’idea che poche interazioni contano, coinvolgono pochi elementi e spesso sono gerarchiche.
Cosa permette di osservare
Permette di esplorare come spiegare errori o comportamenti inattesi identificando gruppi di parole, esempi di addestramento o parti interne che agiscono insieme, e quali scelte si possono fare sui dati o sull’architettura rimuovendo ridondanze o conservando sinergie.
Dalla fonte
> Understanding the behavior of complex machine learning systems, particularly Large Language Models (LLMs), is a critical challenge in modern artificial intelligence. Interpretability research aims to make the decision-making process more transparent to model builders and impacted humans, a step toward safer and more trustworthy AI. To gain a comprehensive understanding, we can analyze these systems through different lenses: feature attribution , which isolates the specific input features driving a prediction ( Lundberg & Lee, 2017 ; Ribeiro et al., 2022 ); data attribution , which links model behaviors to influential training examples ( Koh & Liang, 2017 ; Ilyas et al., 2022 ); and mechanistic interpretability , which dissects the functions of internal components ( Conmy et al., 2023 ; Sharkey et al., 2025 ). Across these perspectives, the same fundamental hurdle persists: complexity…