LookBack: Where and How to Score LVLM Responses via Visual Reference Usage
Di cosa parla
Si affronta il problema di valutare le risposte di modelli che combinano visione e linguaggio: questi sistemi possono inventare dettagli non presenti nell’immagine e le misure di fiducia prese dai modelli testuali tendono a premiare solo la plausibilità della frase, non l’accordo con ciò che si vede. La proposta, chiamata LookBack, è un metodo senza addestramento che affianca al punteggio delle parole un “punteggio di richiamo visivo”, ossia quanto ogni parola della risposta fa riferimento a parti dell’immagine; nei test su più modelli migliora la scelta delle risposte migliori con un costo aggiuntivo trascurabile.
Cosa permette di osservare
Consente di esplorare come capire se una risposta è davvero basata sull’immagine o solo verbalmente plausibile, e di valutare approcci pratici per rivedere e confrontare risposte senza dover riaddestrare il modello.
Dalla fonte
Large Vision-Language Models (LVLMs) integrate visual perception with language generation, enabling responses that span image understanding and complex reasoning. However, LVLMs do not just inherit the text-level hallucinations; they also hallucinate against the image, producing fluent responses ungrounded in what they see. This makes LVLM response scoring inherently harder, and our diagnostics show that existing confidence-based metrics adopted from LLMs are insufficient for LVLMs. Specifically, removing the input image barely changes confidence-based selection, suggesting that output-space confidence primarily captures textual plausibility rather than agreement with the image. To address this gap, we propose LookBack, a training-free LVLM response scoring method that augments token likelihood with visual lookback score, a lightweight measure of how strongly each response token refers…