AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

Achieving Near-Zero-Overhead Multi-Model Hierarchical Classification in Real-Time Detection Pipelines

Di cosa parla

Si mostra come far girare in tempo reale, su dispositivi edge, pipeline di visione che uniscono un rilevatore e classificatori senza sovraccaricare la stessa risorsa di calcolo. Gli autori descrivono una metodologia in cinque passi per adattare e convertire classificatori in modo che possano eseguire su acceleratori neurali dedicati di una piattaforma commerciale (NVIDIA Jetson), affrontando la perdita di precisione numerica e altri vincoli pratici, e documentano soluzioni ingegneristiche e limiti osservati; la validazione indica che l’esecuzione concorrente non aggiunge ritardi apprezzabili.

Cosa permette di osservare

Permette di esplorare se e come sfruttare gli acceleratori neurali integrati nei chip per scaricare la classificazione dalle risorse principali, quali problemi pratici emergono (perdita di precisione, incompatibilità di conversione, vincoli di compilazione) e quali scelte tecniche sono necessarie.

hardwareregolamentazionericerca

Dalla fonte

Edge-deployed vision systems in target recognition, surveillance, autonomous vehicles, and drone domains require hierarchical inference pipelines where a detection model identifies objects of interest and downstream classifiers provide fine-grained attribute analysis. Running all models on the GPU creates a serial bottleneck that limits real-time throughput as pipeline stages grow. Modern edge SoCs pair GPUs with dedicated neural accelerators (NPUs, DLAs) capable of concurrent execution, yet deploying custom models on these accelerators remains impractical due to strict operator constraints, quantization incompatibilities, and an undocumented end-to-end pipeline. We target NVIDIA Jetson DLA cores as the representative platform. We present a five-step methodology for zero GPU fallback DLA INT8 deployment of classification backbones, comprising architecture adaptation, manual dynamic rang…