AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

Di cosa parla

Si interviene direttamente nelle scelte del modello mentre genera testo, bloccando le opzioni più ovvie alla fine delle parole e costringendolo a riformulare le risposte. Applicando questo test a vari modelli aperti, gli autori osservano che la capacità di resistere a questo 'stress' cresce con la grandezza del modello e con l'addestramento che lo insegna a seguire istruzioni; la tecnica può anche generare dati sintetici e aiutare a verificare le misure di sicurezza prima dell'uso.

Cosa permette di osservare

Fa capire quanto un modello resta affidabile quando viene spinto fuori dalla sua modalità abituale e aiuta a confrontare scelte come la dimensione del modello o l'addestramento successivo per insegnargli a seguire istruzioni.

modelli linguisticiregolamentazionericercasicurezza

Dalla fonte

Large language model evaluations typically focus on performance under nominal conditions, creating an illusion of capability where models comfortably walk a narrow, highly optimized generation corridor. In real-world deployments, however, complex system prompts, safety guardrails, and structural constraints continuously force models off this nominal path, driving a divergence between benchmark scores and deployment performance. To address this issue, we introduce Decoding-Level Taboo, a zero-prompt diagnostic stress test that intervenes directly in logit space at runtime, forcing models out of their nominal paths. By dynamically masking primary candidate tokens at word boundaries, Taboo forces machine circumlocution. Evaluating Taboo across several open-weight model families reveals that off-path robustness is heavily influenced by both parameter scale and post-training instruction alig…