AI Observatory · Magazine indipendente sull’intelligenza artificiale Capire cosa sta accadendo nel mondo AI.
AI Observatory Notizie, ricerca, prodotti e trasformazioni.

Un magazine per orientarsi nel mondo dell’intelligenza artificiale senza dover inseguire decine di fonti diverse.

Modelli & Prodotti · 14 Agosto 2026 · 2 min

Kog punta a estrarre più prestazioni dalle GPU datacenter per accelerare l’inferenza LLM

Sintesi. La startup francese Kog ha presentato una tech preview che mostra come il suo Kog Inference Engine (KIE) possa aumentare la velocità di decoding per singole richieste su GPU datacenter comuni (es. AMD MI300X, NVIDIA H200). Nel demo ha usato il modello open‑source Laneformer 2B ottenendo 3.000 token per secondo; l’azienda afferma di aver raccolto 200 lead commerciali e punta a dimostrare un primo modello principale a 10× entro settembre.

Cosa è successo

Kog, guidata dal CEO Gaël Delalleau, sostiene di poter migliorare l’inferenza LLM sfruttando ottimizzazioni software sulle GPU datacenter esistenti. La tech preview, pubblicata a maggio, ha usato AMD MI300X e NVIDIA H200 e il modello Laneformer 2B (circa 2 miliardi di parametri) per raggiungere 3.000 TPS. L’azienda propone KIE a clienti enterprise e design partner che richiedono risposte più rapide; il team conta 11 persone e la startup è supportata da Scaleway, Bpifrance e French Tech 2030.

Perché è rilevante

La notizia mette in luce una possibile strategia per ridurre colli di bottiglia di velocità e costi nell’inferenza: invece di puntare a hardware specialistico, Kog prova a estendere le prestazioni delle GPU già in uso tramite ingegneria a basso livello. Se confermate su LLM più grandi, queste ottimizzazioni potrebbero ridurre la necessità di nuovi investimenti hardware per alcune applicazioni professionali; tuttavia le prestazioni finora sono dimostrate solo su un modello relativamente piccolo e restano da verificare su modelli di produzione maggiori.

Contesto

Nel mercato dell’accelerazione AI si confrontano approcci hardware (es. Cerebras) e software. Kog si colloca tra chi propone ottimizzazioni software per GPU tradizionali; aziende come ZML offrono soluzioni hardware‑agnostiche che aggirano CUDA, mentre Kog dice di avvicinarsi per metodo a ricerche di laboratorio come Hazy Research. La fonte non fornisce ulteriori dati comparativi sulle prestazioni su LLM di produzione.


Fonte: techcrunch.com