AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
contenuto · NVIDIA Developer

Enhancing Goodput in Large-Scale LLM Training with Nonuniform Tensor Parallelism

Di cosa parla

Si presenta un modo per rendere più efficiente l’addestramento di grandi modelli linguistici quando i lavori occupano centinaia o migliaia di dispositivi di calcolo e durano a lungo. L’idea è ripartire il lavoro in modo non uniforme tra le risorse per affrontare le sfide infrastrutturali che emergono a queste scale, aumentando la quantità di lavoro effettivamente utile completata nel tempo.

Cosa permette di osservare

Permette di esplorare come organizzare e suddividere il lavoro su vaste risorse di calcolo per ridurre sprechi e migliorare i progressi reali nell’addestramento di modelli molto grandi.

hardwaremodelli linguistici

Dalla fonte

Training LLMs at massive scale brings unique infrastructure challenges, especially as jobs span thousands of GPUs and run for extended periods. The longer these...