AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

A Theoretical Framework for Modular Learning of Robust Generative Models

Di cosa parla

Si propone di costruire grandi modelli generativi combinando piccoli specialisti, governati da una regola leggera che decide quale esperto usare, invece di addestrare un unico modello enorme. Viene sviluppato un quadro teorico che dimostra l'esistenza di una regola robusta per miscele di dati, mostra come la modularità favorisca la generalizzazione e indica quando può superare un modello ricondizionato sui dati aggregati. Propongono algoritmi scalabili e verifiche sperimentali.

Cosa permette di osservare

Permette di esplorare se sommare piccoli esperti può sostituire un grande modello unico, se una sola regola può restare robusta di fronte a miscele di dati impreviste, e quale compromesso esiste tra semplicità della regola e capacità di generalizzare.

modelli linguisticiregolamentazionericerca

Dalla fonte

Training large-scale generative models is resource-intensive and relies heavily on heuristic dataset weighting. We address two fundamental questions: Can we train Large Language Models (LLMs) modularly, combining small, domain-specific experts to match monolithic performance, and can we do so robustly for any data mixture, eliminating heuristic tuning? We present a theoretical framework for modular generative modeling where a set of pre-trained experts are combined via a gating mechanism. We define the space of normalized gating functions $\mathcal{G}_{1}$ and formulate the problem as a minimax game to find a single robust gate that minimizes divergence to the worst-case data mixture. We prove the existence of such a robust gate using Kakutani's fixed-point theorem and show that modularity acts as a strong regularizer, with generalization bounds scaling with the lightweight gate's compl…