AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Easper: An Accessible ASR Pipeline for Language Documentation

Di cosa parla

Easper è un flusso di lavoro open source e senza codice che permette a linguisti di adattare modelli di trascrizione automatica del parlato partendo dalle annotazioni in ELAN e usando risorse cloud. Si propone di superare il collo di bottiglia della trascrizione nella documentazione linguistica e il problema iniziale di decidere quali registrazioni trascrivere per avviare il modello. Testato su tre lingue di Vanuatu, mostra che dare priorità a narrazioni ricche dal punto di vista lessicale e a esempi con ripetizioni acustico-fonetiche accelera i miglioramenti della qualità anche in presenza di rumore.

Cosa permette di osservare

Permette di esplorare quale criterio scegliere per iniziare le trascrizioni — privilegiare tracce acusticamente più pulite o quelle più ricche linguisticamente — e se la scelta di includere ripetizioni fonetiche possa far progredire più rapidamente il modello anche con registrazioni rumorose.

open sourceregolamentazionericercavoce

Dalla fonte

Audio transcription is a critical bottleneck in language documentation. While multilingual Automatic Speech Recognition (ASR) models like Whisper offer solutions, field linguists often lack the expertise to utilise them. We present Easper, an open-source, no-code workflow enabling linguists to iteratively fine-tune ASR models via cloud resources directly from ELAN annotations. Deploying ASR also raises a cold start problem: deciding which recordings to transcribe first to bootstrap an accurate model. Using Easper, we evaluate transcription prioritisation strategies on three Vanuatu languages (Bislama, Nafsan, Nguna). We fine-tune models by recording session, comparing Character Error Rate trajectories when prioritising acoustic cleanliness versus linguistic richness. We demonstrate that prioritising lexically rich narratives and increasing acoustic-phonetic repetition, even in noisy env…