A Simple Efficiency Incremental Learning Framework via Vision-Language Model with Nonlinear Multi-Adapters
Di cosa parla
SimE è un quadro semplice ed efficiente che sfrutta un modello che associa immagini e parole con moduli adattivi per l'apprendimento incrementale, cioè imparare nuovi compiti senza dimenticare quelli già appresi. Mira a rendere l'addestramento più veloce, evitare la conservazione di dati precedenti e non richiedere una base di modello molto grande. Gli autori osservano che il numero e la posizione di queste connessioni adattive influenzano in modo non lineare le prestazioni.
Cosa permette di osservare
Consente di esplorare il trade-off tra semplicità del modello e capacità di apprendere progressivamente, e come utilizzare modelli pre-addestrati che collegano immagini e testo per ridurre la necessità di memorizzare esempi passati.
Dalla fonte
Incremental Learning (IL) aims to learn new tasks while preserving previously acquired knowledge. Integrating the zero-shot learning capabilities of pre-trained vision-language models into IL methods has marked a significant advancement. However, these methods face three primary challenges: (1) the need for improved training efficiency; (2) reliance on a memory bank to store previous data; and (3) the necessity of a strong backbone to augment the model's capabilities. In this paper, we propose SimE, a Simple and Efficient framework that employs a vision-language model with adapters designed specifically for the IL task. We report a remarkable phenomenon: there is a nonlinear correlation between the number of adaptive adapter connections and the model's IL capabilities. While increasing adapter connections between transformer blocks improves model performance, adding more adaptive connec…