Apple Research scala le Categorical Flow Maps: testo di qualità in 4 passi con un modello da 1,7 miliardi
Sintesi. Un gruppo di ricercatori (tra cui autori affiliati a Apple e University of Oxford) ha addestrato un modello di flow matching da 1,7 miliardi di parametri su 2,1 trilioni di token e lo ha auto-distillato in una Categorical Flow Map (CFM). Secondo gli autori, la CFM genera testo vario e di alta qualità in appena quattro passi di inferenza, conserva un'entropia dei token vicina a quella dei dati e può essere valutata tramite un bound di verosimiglianza nel setting semi-discreto.
Cosa è successo
Nel paper "Scaling Categorical Flow Maps" i ricercatori descrivono l'addestramento di un modello base di flow matching da 1,7 miliardi di parametri su 2,1T token e la sua auto-distillazione in una CFM capace di generare testo in pochi passi (fino a 4). Introducono inoltre un bound di likelihood per CFMs nel contesto semi-discreto che consente di usare le CFMs per scoring su benchmark di language modelling; riportano risultati comparabili a quelli di metodi di diffusione discreta. Il lavoro segnala infine difficoltà incontrate alla scala considerata e suggerisce indicazioni pratiche su pesatura della loss e scheduling temporale.
Perché è rilevante
Il lavoro mostra la fattibilità, su scala superiore al miliardo di parametri, di approcci continui (flow matching / CFMs) per generare dati discreti come il testo, beneficiando di vantaggi tipici delle modalità continue come campionamento accelerato e tilting. Pur non dichiarando una supremazia rispetto agli autoregressivi, lo studio apre la possibilità che tecniche di flow matching siano un'alternativa praticabile per generatione testuale a bassa latenza, e mette in evidenza le difficoltà tecniche che emergono nel passaggio a modelli più grandi.
Contesto
Precedenti lavori avevano dimostrato CFMs e campionamento accelerato a scale inferiori (sotto 1B parametri); la novità qui è l'applicazione a 1,7B e l'uso di 2,1T token. Gli autori collegano il loro contributo ad altri studi su distillazione e reparameterization per flow matching citati nel blog, ma la fonte non estende il confronto al mercato o a prodotti commerciali.
Fonte: machinelearning.apple.com

