AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Causal Structure is Inducible but Functionally Decoupled: The Routing/Readout Boundary of a Typed Mechanism Library

Di cosa parla

Hanno esaminato come un modello linguistico organizza conoscenze causali quando deve rispondere a domande che implicano interventi, costruendo una libreria di “slot” che separano l’evidenza per tipo e che si può ispezionare internamente. Risultato: la supervisione per tipo induce uno smistamento organizzato, ma i codici degli slot servono solo a instradare l’informazione e non determinano la risposta; la struttura non peggiora la qualità ed è modificabile e ripristinabile a livello di stato, con tutte le verifiche preregistrate e tracciate.

Cosa permette di osservare

Questo lavoro apre alla domanda se una supervisione mirata possa creare una netta separazione tra lo smistamento dell’evidenza e la fase che produce la risposta, e su come questa separazione influenzi la possibilità di capire o confrontare i processi interni dei modelli, specialmente a diverse dimensioni.

modelli linguisticiregolamentazionericerca

Dalla fonte

When a language model answers an interventional question, the computation it must perform depends on the type of evidence the query requires. We report a decoupling in how a transformer organizes causal knowledge: slot-by-type structure induced by type-level supervision organizes routing, yet remains functionally decoupled from answer readout. We establish this with a typed mechanism library -- discrete mechanism slots partitioned by evidence type, auditable at the state level -- on a causal-world benchmark with exact interventional ground truth, under a frozen protocol, at two scales (22.6M and 125M). Four preregistered findings. (i) Origin. Slot-by-type organization is induced by type-level supervision: absent in architecturally identical unsupervised controls, not buyable by content-free gating labels, and statistically attributable to the supervision signal, replicating at 125M unde…