Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
Di cosa parla
In modelli linguistici che mescolano due tipi di meccanismi per "concentrarsi" sul testo, gli autori descrivono ampie esplosioni di attività interna, chiamate "attivazioni massive", che compaiono subito prima dei blocchi che realizzano la concentrazione completa e che possono persistere attraverso i blocchi più semplici formando plateaux di attività. Hanno riscontrato questo schema in varie architetture e dati, osservato che un meccanismo di controllo sull'uscita ne riduce l'ampiezza senza cancellarne l'organizzazione a strati, proposto che tutto dipenda dal momento in cui l'attività viene annullata nel tempo, e reso pubblico il codice.
Cosa permette di osservare
Consente di esplorare come scelte architetturali e meccanismi di controllo influenzano la dinamica interna dei modelli: perché si formano quei picchi, quanto possono durare attraverso i diversi blocchi e come il loro annullamento nel tempo ne modula la struttura.
Dalla fonte
We present the first systematic study of Massive activations (MAs) in layer-interleaved HLA LLMs and uncover two architecture-aligned morphologies: MAs consistently spike immediately before full attention layers, forming pre-attention spikes (PAS), and can persist through intervening linear attention layers, giving rise to inter-spike plateaus (ISP). As full attention becomes denser, successive PAS become increasingly connected through ISP, ultimately recovering the stable MA morphology of full attention LLMs. We establish the recurrence of this organization across five linear attention architectures, six hybridization configurations, five data domains, and representative open-source hybrid models spanning 1.2B to 397B total parameters. Controlled pretraining of GDN-based hybrids at scales up to 1.3B shows that both morphologies emerge early and respond asymmetrically to output gating:…