MinGram: A Minimalist Unigram Tokenizer with High Compression and Competitive Morphological Alignment
Di cosa parla
MinGram è un metodo più semplice per costruire il vocabolario usato dai modelli di linguaggio: semplifica l'addestramento del 'tokenizer' — lo strumento che spezza il testo in pezzi usati dal modello — eliminando passaggi complessi e privilegiando la riduzione del numero di pezzi. L'idea è ottenere una compressione del testo migliore mantenendo una buona corrispondenza con la forma delle parole; nei test ha funzionato meglio rispetto a metodi tradizionali.
Cosa permette di osservare
Permette di esplorare come bilanciare semplicità di addestramento, efficienza di compressione e fedeltà alla morfologia delle parole quando si sceglie o si progetta uno strumento per spezzare il testo destinato ai modelli.
Dalla fonte
The Unigram tokenizer uses an elegant representation which makes it straightforward to edit vocabularies, but its training is comparatively heavy and complex. We introduce MinGram (Minimalist Unigram), which keeps the token-list representation but simplifies training using a BPE-derived seed vocabulary, Hard EM on a minimum-token path, and a single flat score-pruning step. This removes the suffix array, the forward-backward pass, and the iterative prune loop, leaving a procedure that requires little beyond tokenizer inference itself. By making token count the primary objective and using a Unigram score only as a tiebreak, MinGram keeps the compression of pure token-count methods while retaining much of the morphological alignment and downstream quality of probabilistic ones. Across six languages, MinGram compresses better than both BPE and standard Unigram, and a compression-oriented va…