AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference

Di cosa parla

Si cerca di rendere più veloce la generazione dei modelli linguistici basati su diffusione: questi modelli aggiornano molte parti del testo insieme, ma nella pratica la procedura continua per un numero fisso di passaggi anche quando molte scelte si stabilizzano prima, causando calcoli ripetuti. CORA-Diff propone un meccanismo senza addestramento che riconosce le posizioni la cui previsione è già stabile e le accetta come definitive; tali posizioni restano visibili come contesto e il blocco di decodifica termina quando tutte le posizioni sono risolte, senza modificare il modello né i segnali di previsione interni.

Cosa permette di osservare

Consente di esplorare se i segnali interni di confidenza e di persistenza nelle previsioni possono essere usati per fermare anticipatamente alcune scelte senza ritoccare o riaddestrare il modello, e come questa strategia influisce sul bilancio tra velocità di esecuzione e qualità dell'output su diversi compiti e protocolli.

immaginimodelli linguisticiregolamentazionericerca

Dalla fonte

Diffusion language models (DLMs) update many tokens in parallel, yet practical decoders often use a fixed denoising horizon. Many predictions stabilize early, but blockwise decoding continues until all positions are resolved, causing repeated dense forward passes. Existing accelerators often rely on learned filters, modified scores, dependency models, or cache-specific mechanisms. We ask whether native trajectory signals can identify residual positions likely to match the deterministic dense endpoint. We propose CORA-Diff, a training-free method that preserves the original transfer rule and applies confidence-and-persistence gating only to positions that rule leaves unresolved. Accepted tokens remain visible as context, and the block terminates once all positions are resolved. This requires no backbone change, learned acceptance model, or logit modification. Our theory explains why high…