AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

What Iterated Self-Feeding Probes of Language Models Measure, and a test that separates the construction from the model

Di cosa parla

Si analizzano metodi che fanno ripetere a un modello di linguaggio le proprie risposte, creando una sequenza circolare di frammenti di testo che il modello riscrive più volte. L'obiettivo è capire se ciò che si osserva — per esempio come si propaga una piccola differenza tra due copie — dipende dal modello o dal modo in cui è costruito il test. Gli autori mostrano che il metodo mescola due effetti diversi, propongono un test per separarli variando o il modello o la costruzione, forniscono il pacchetto per riprodurre i risultati e segnalano quattro verdetti precedenti ritirati perché dovuti a errori di stima.

Cosa permette di osservare

Permette di esplorare se fenomeni osservati quando un modello si autoalimenta sono proprietà intrinseche del modello o artefatti del metodo di misura, e di decidere se variare il modello o variare il test per saperlo.

agentihardwaremodelli linguisticiregolamentazionericerca

Dalla fonte

A growing class of methods probes a language model by feeding it its own output: self-consistency, iterated refinement, agentic loops. We ask what such a probe measures, in a construction chosen to make the question sharp: a ring of token cells resampled in place by the model's own windowed conditional p_r(x_i | x_{i+-r}). The substrate is Glauber dynamics on token sequences and is not new; what we change is the coupling. Advancing two rings that differ in one token under common random numbers makes undamaged copies diverge by exactly zero, so damage spreading becomes measurable where a maximal coupling gives mixing times instead. The answer is that it measures two different things at once, in readings that look alike. Some quantities are fixed by the construction: the damage light cone is kinematic, and the radius scaling of the token-space Lyapunov exponent lambda_ca(r) is model-invar…