AI Observatory · Magazine indipendente sull’intelligenza artificiale Capire cosa sta accadendo nel mondo AI.
AI Observatory Notizie, ricerca, prodotti e trasformazioni.

Un magazine per orientarsi nel mondo dell’intelligenza artificiale senza dover inseguire decine di fonti diverse.

News · 14 Agosto 2026 · 2 min

Hugging Face e la community hanno riprodotto 2.226 paper di ICML 2026: risultati e limiti

Sintesi. In un hackathon tenuto dal 15 luglio al 2 agosto 2026, Hugging Face e 1.221 partecipanti hanno pubblicato 6.816 ‘Trackio’ logbook tentando la riproduzione di 2.226 paper di ICML 2026 (circa il 34% della conferenza). Un giudice automatico ha valutato 35.908 singole affermazioni; il 51% delle carte esaminate ha avuto almeno una rivendicazione verificata, mentre il 23% ha presentato almeno una rivendicazione falsificata o contestata.

Cosa è successo

L’iniziativa ha indicizzato gli articoli accettati e ha estratto affermazioni verificabili; i partecipanti hanno usato vari coding agent (Claude Code, Codex, Cursor, orx e altri) per eseguire esperimenti e pubblicare logbook statici contenenti codice, artefatti e, opzionalmente, tracce d’esecuzione. Un modello open-weights (GLM-5.2) ha emesso per-claim verdict: verified, falsified, toy o inconclusive. I partecipanti hanno lanciato 2.962 lavori cloud su Hugging Face Jobs; dove necessario sono state eseguite riproduzioni su scala ridotta con dati sintetici.

Perché è rilevante

L’evento mostra che gli agenti possono scalare l’esecuzione sperimentale e aiutare a verificare grandi volumi di ricerca, ma mette anche in luce limiti pratici: mancanza di artefatti pubblici, comportamenti scala-dipendenti e errori di implementazione possono ostacolare la verifica automatica. I risultati concreti — inclusi falsificazioni teoriche e discrepanze tra codice e enunciati pubblicati — evidenziano la necessità di flussi di lavoro umano-in-the-loop e di pratiche più auditable nella ricerca ML.

Contesto

La sfida si svolge in un contesto di crescita rapida delle submission a ICML (il post riporta 23.918 sottomissioni e circa 6.352 paper accettati) e di preoccupazioni preesistenti sulla riproducibilità. Gli organizzatori presentano l’evento come probabilmente il più grande audit claim-by-claim aperto su una conferenza ML, con tutti i logbook e i verdict pubblici.


Fonte: huggingface.co