OrderMoE: An expert similarity driven distributed edge MoE inference
Di cosa parla
Si occupa di modelli che suddividono il lavoro tra molti “esperti” interni e di come farli funzionare su server ai margini della rete, con risorse e banda limitate. Propone OrderMoE, un approccio che identifica quali esperti si comportano in modo simile, li raggruppa e li distribuisce per mantenere più elaborazione locale. In tempo reale sceglie se mandare il lavoro a un esperto remoto o usare un sostituto locale, cercando di bilanciare velocità, traffico tra server, carico e qualità delle risposte.
Cosa permette di osservare
Permette di esplorare la scelta tra inviare lavoro a server remoti o usare esperti locali simili, valutando quanto convenga accettare un piccolo calo nella qualità per ridurre scambi di dati e velocizzare le risposte sui dispositivi ai margini della rete.
Dalla fonte
Although mixture-of-experts, MoE, models have been increasingly adopted to scale large language models with moderate computation cost, it remains challenging to deploy MoE inference over resource-constrained and bandwidth-limited edge infrastructures. Existing distributed MoE serving methods mainly rely on exact expert placement, caching, replication, or communication scheduling, while overlooking the functional similarity among experts, which provides an opportunity to reduce cross-server token transmission. Therefore, this paper introduces a similarity-aware expert allocation and distributed deployment framework, dubbed OrderMoE, which aims to accelerate edge MoE inference while balancing inference latency, communication overhead, server workload, and inference quality. OrderMoE first constructs an expert similarity model based on router-induced logits representations and partitions e…