Linear-Core Surrogates: Smooth Loss Functions with Linear Rates for Classification and Structured Prediction
Di cosa parla
Una nuova famiglia di funzioni di perdita per classificazione e predizione strutturata unisce un "nucleo" lineare a una "coda" liscia, ottenendo perdite differenziabili ovunque. L’idea è risolvere la tensione tra facilità d’ottimizzazione e robuste garanzie statistiche: queste perdite mantengono una relazione lineare tra il miglioramento della funzione di perdita e il miglioramento delle predizioni. Gli autori mostrano risultati in contesti binari, multi-classe e di predizione strutturata, con vantaggi pratici come maggiore robustezza a etichette rumorose e addestramento più rapido su compiti con grandi spazi di uscita.
Cosa permette di osservare
Permette di esplorare se si può avere insieme una perdita liscia e differenziabile e, allo stesso tempo, una garanzia che migliorare la perdita porti proporzionalmente a migliori predizioni, oltre a capire l’impatto su robustezza a errori di etichettatura e efficienza nei compiti complessi.
Dalla fonte
A fundamental dichotomy in the theory of classification sets smoothness against statistical efficiency: smooth surrogate losses such as the logistic loss enable fast $O(1/T)$ optimization but yield slow square-root $H$-consistency bounds, while piecewise-linear losses like the Hinge loss achieve optimal linear $H$-consistency rates but are non-differentiable. We introduce Linear-Core (LC) Surrogates, the first family of explicit convex loss functions that provably resolve this tension. By stitching a linear core to a smooth tail, we construct surrogates that are differentiable everywhere ($C^1$, and even $C^2$ under mild conditions) while retaining strict linear $H$-consistency bounds, the strongest known form of consistency guarantee. We establish these linear bounds across three increasingly complex settings: binary classification, multi-class classification, and structured prediction…