AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Poly-Dialectal Neural Machine Translation System for Bangla Regional Dialects

Di cosa parla

Hanno messo a punto un sistema di traduzione capace di convertire direttamente tra molte varianti regionali del Bangla, affrontando il problema che i dialetti locali differiscono molto dallo standard e vengono mal tradotti dai modelli usuali. Per farlo hanno raccolto un vasto corpus parallelo tra dialetti, adattato modelli di traduzione e reso il risultato accessibile via un’app web per comunità dialettali emarginate.

Cosa permette di osservare

Consente di esplorare se un unico sistema può gestire tante varianti regionali senza passare per lo standard, quanto dati servono per adattare dialetti poveri di risorse e come migliora la comunicazione tra parlanti di diversi dialetti.

modelli linguisticiregolamentazionericerca

Dalla fonte

Regional dialectal variation poses a fundamental challenge to natural language processing (NLP) in Bangla, where over 240 million speakers communicate across diverse regional variants that diverge significantly from Standard Colloquial Bangla (SCB) in phonology, morphology, and lexicon. Contemporary neural machine trans- lation (NMT) architectures and large language models (LLMs) predominantly as- sume a homogeneous language distribution, resulting in severe performance degra- dation when translating low-resource regional dialects. In this work, we present a unified Poly-Dialectal Neural Machine Translation System capable of multi-directional translation across 12 Bangla regional dialects without routing through an inter- mediary standard pivot. We compile the largest multi-dialect parallel corpus for Bangla to date, comprising 51,531 non-null parallel sentence pairs across 12 di- alect…