AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

ArtiFact: A Large-Scale Multi-Modal Cultural Heritage Dataset

Di cosa parla

ArtiFact è un archivio su larga scala che riunisce tabelle, testi e immagini di oggetti d'arte provenienti da tre grandi musei. Serve come banco di prova per due compiti pratici: individuare errori che emergono confrontando descrizioni, tabelle e immagini (per esempio incongruenze su materiali o date) e verificare quanto i sistemi riescono a gestire ricerche basate sul significato, termini storici e somiglianze culturali.

Cosa permette di osservare

Permette di esplorare fino a che punto gli strumenti automatici sanno riconoscere incoerenze sottili tra fonti diverse e comprendere query che dipendono da contesti storici, terminologia ambigua o vicinanza culturale, ambiti dove i sistemi mostrano difficoltà.

regolamentazionericerca

Dalla fonte

Multi-modal data management has emerged as a central research topic in the database community, spanning data integration, semantic query processing, and data quality assessment. Despite this growing interest, the community lacks large-scale, real-world datasets combining tables, text, and images. We present ArtiFact, a multi-modal cultural heritage dataset of 651045 museum records collected from the Metropolitan Museum of Art, the Art Institute of Chicago, and the Rijksmuseum. We demonstrate the utility of ArtiFact through two downstream tasks. For cross-modal error detection, we introduce a curated taxonomy of seven error categories injected into 130209 records and show that reliably detecting subtle domain-specific errors such as material anachronisms and temporal shifts remain an open challenge. For semantic query processing, we show that current systems struggle with queries involvi…