AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
contenuto · aws-machine-learning

Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine

Di cosa parla

I modelli linguistici grandi tengono in memoria alcune informazioni già calcolate per rispondere più in fretta: questa memoria si chiama KV cache. Il post descrive come su Amazon SageMaker HyperPod sia stata costruita una cache a livelli che estende quella memoria su un pool di archiviazione condivisa tramite Curvine, così le copie del modello possono riutilizzare la cache quasi alla velocità del disco locale usando macchine cloud più economiche.

Cosa permette di osservare

Permette di esplorare il compromesso tra usare macchine cloud molto grandi e costose o condividere la cache su uno storage veloce per mantenere risposte rapide, e capire se lo storage condiviso può ridurre i costi senza rallentare troppo la prima risposta.

hardwaremodelli linguistici

Dalla fonte

Running large language model inference at scale forces a KV cache trade-off: oversized GPU instances or slow time-to-first-token. This post builds a tiered KV cache on Amazon SageMaker HyperPod that extends the cache into a shared, distributed NVMe pool with Curvine, so replicas reuse cache at near-local-disk speeds on cost-efficient instances.