HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference
Di cosa parla
I modelli 'Mixture-of-Experts' — che attivano solo alcuni moduli specializzati per ciascun input — sono difficili da far funzionare su server edge distribuiti e diversi tra loro perché gli esperti attivati possono essere sparsi in più macchine. HetRoute propone un modo unificato per valutare il costo di ogni assegnazione (trasferimento tra server, spostamenti interni tra unità di calcolo e processore, attesa in coda e perdita di qualità dovuta alla riduzione di precisione delle copie) e, sulla base di questo, organizza dove collocare gli esperti e come instradare le richieste in tempo reale per minimizzare i colli di bottiglia.
Cosa permette di osservare
Consente di capire come bilanciare tre variabili spesso in conflitto: velocità di risposta, uso della rete e perdita di qualità quando si eseguono parti specializzate di un modello su server edge sparsi. Offre spunti su come progettare la distribuzione e il routing delle richieste in scenari reali.
Dalla fonte
Mixture-of-Experts (MoE) models have become a dominant architecture for large-scale AI services, yet deploying them over geo-distributed heterogeneous edge servers remains challenging. When the Top-k activated experts of a token are spread across multiple servers, the optimal routing depends jointly on cross-server link bandwidth, heterogeneous GPU computing capability, GPU-CPU expert loading delay, instantaneous queueing backlog, and replica-level quantization quality loss. Existing distributed inference and MoE serving methods address these factors separately and do not provide a unified framework for online multi-server collaborative routing. In this paper, we propose HetRoute, a heterogeneous-cost-aware collaborative routing framework for distributed edge MoE inference. HetRoute introduces a unified per-assignment cost model that explicitly captures four cost components: cross-serve…