LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration
Di cosa parla
Una tecnica per accelerare la generazione di video dai modelli di diffusione che riduce il costo dei calcoli fatti su come le varie parti del video si collegano tra loro ad ogni passo: quel processo diventa molto pesante quando aumentano risoluzione e durata. L'approccio individua, in una fase iniziale, quali collegamenti sono davvero rilevanti e tiene fissa quella scelta per i passaggi successivi, eliminando molte operazioni ma conservando quasi tutta l'informazione utile, il tutto senza riaddestrare il modello.
Cosa permette di osservare
Fa riflettere su quanto si possa ridurre il lavoro computazionale nella creazione di video mantenendo la qualità percepita, e su come scegliere collegamenti stabili all'inizio del processo si combini con altre ottimizzazioni che non richiedono nuovo addestramento.
Dalla fonte
Video diffusion transformers are costly to sample: every denoising step applies self-attention over a long 3D token sequence, a quadratic cost that dominates as resolution and duration grow. Sparse attention reduces this cost without retraining, but existing methods pursue aggressive sparsity, where further speedup costs disproportionately more attention fidelity. We target the opposite end of this trade-off: fix near-lossless fidelity by construction, and remove as much computation as this constraint permits. Two observations make this regime practical: roughly 40% of block interactions can be removed while retaining 99% of the attention mass, and the high-mass support remains stable across denoising steps. We propose LoSA, a training-free sparse-attention method that fixes a retained-mass threshold of 99% rather than a sparsity ratio: it measures exact block attention masses at one ea…