AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness

Di cosa parla

Dimostrano che l’addestramento con la discesa del gradiente converge per reti neurali a strati di qualsiasi larghezza o profondità, senza bisogno di inizializzazioni o dataset particolari. L’unica assunzione è che le funzioni di attivazione abbiano buone proprietà di regolarità (per esempio tanh, sigmoid, softplus o la funzione lineare) e che la perdita sia regolare. L’intuizione chiave è che queste proprietà si mantengono in parte quando le funzioni vengono composte ripetutamente, il che permette di controllare quanto cambia il gradiente rispetto alle variazioni dei parametri e alla loro grandezza; così, con passi di aggiornamento abbastanza piccoli rispetto alla grandezza dei parametri, la perdita diminuisce e il gradiente tende a ridursi durante l’addestramento.

Cosa permette di osservare

Serve per esplorare quando e perché l’algoritmo di addestramento porta a punti in cui gli aggiornamenti diventano sempre più piccoli, e quanto le caratteristiche delle funzioni di attivazione o la crescita dei pesi influiscano su quella stabilità.

hardwareregolamentazionericerca

Dalla fonte

We establish convergence guarantees of gradient descent for general feedforward neural networks of arbitrary width or depth, with no special requirements on the initialization or dataset. We only assume that the activation functions are Lipschitz smooth, Lipschitz continuous, and linearly bounded--- properties that hold for linear, tanh, softplus, and sigmoid activation functions. For the loss function, we require that it is Lipschitz smooth in the model outputs, which is true for mean-squared error. The key theoretical insight is that the Lipschitz properties of the activation functions are partially preserved even through repeated compositions, leading to a novel generalized Lipschitz smoothness condition where the change in gradient is upper bounded by the change in the parameter space, multiplied by polynomial terms of the parameter norms at both endpoints. This type of condition ho…