AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

LookBack: Where and How to Score LVLM Responses via Visual Reference Usage

Di cosa parla

Si affronta il problema di valutare le risposte di modelli che combinano visione e linguaggio: questi sistemi possono inventare dettagli non presenti nell’immagine e le misure di fiducia prese dai modelli testuali tendono a premiare solo la plausibilità della frase, non l’accordo con ciò che si vede. La proposta, chiamata LookBack, è un metodo senza addestramento che affianca al punteggio delle parole un “punteggio di richiamo visivo”, ossia quanto ogni parola della risposta fa riferimento a parti dell’immagine; nei test su più modelli migliora la scelta delle risposte migliori con un costo aggiuntivo trascurabile.

Cosa permette di osservare

Consente di esplorare come capire se una risposta è davvero basata sull’immagine o solo verbalmente plausibile, e di valutare approcci pratici per rivedere e confrontare risposte senza dover riaddestrare il modello.

hardwaremodelli linguisticiregolamentazionericerca

Dalla fonte

Large Vision-Language Models (LVLMs) integrate visual perception with language generation, enabling responses that span image understanding and complex reasoning. However, LVLMs do not just inherit the text-level hallucinations; they also hallucinate against the image, producing fluent responses ungrounded in what they see. This makes LVLM response scoring inherently harder, and our diagnostics show that existing confidence-based metrics adopted from LLMs are insufficient for LVLMs. Specifically, removing the input image barely changes confidence-based selection, suggesting that output-space confidence primarily captures textual plausibility rather than agreement with the image. To address this gap, we propose LookBack, a training-free LVLM response scoring method that augments token likelihood with visual lookback score, a lightweight measure of how strongly each response token refers…