AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

Di cosa parla

Gli autori inseriscono brevi sequenze estranee in video più lunghi (per esempio clip pubblicitarie) per verificare se i modelli che analizzano video riescono a collegare correttamente persone e azioni nel tempo. Risultato: i modelli spesso «allucinano» collegamenti, attribuendo azioni delle clip inserite a soggetti del video principale; questo comportamento viene descritto come trattare il video come una raccolta di eventi slegati invece che come una sequenza temporale. I test su modelli popolari mostrano che il problema è diffuso e indicano che manca un meccanismo affidabile per mantenere l’associazione temporale tra soggetti ed eventi.

Cosa permette di osservare

Permette di esplorare se e come i sistemi per i video capiscono l’ordine cronologico degli eventi e distinguono azioni principali da spezzoni estranei, e quali scelte progettuali potrebbero servire per far sì che associino correttamente chi fa cosa e quando.

modelli linguisticiregolamentazionericerca

Dalla fonte

A key capability for video understanding is reliably linking subjects to events across time, yet whether Video Large Language Models (VideoLLMs) actually achieve this remains unclear. In this work, we introduce DistractionBench to evaluate whether VideoLLMs can robustly link subjects and events in the presence of unrelated video segments. Through controlled interventions, such as inserting short advertisement clips into longer videos, we show that VideoLLMs frequently hallucinate interactions between entities from different segments, incorrectly attributing actions from injected advertisements to subjects in the main video. We characterize this systematic hallucination as bag-of-events (BoE) behavior, where models process videos as collections of events rather than temporally structured sequences. Evaluating 11 popular VideoLLMs, we find that all models exhibit substantial BoE behavior.…