AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

TangPoetryBench: A Multi-Dimensional Benchmark and Rubric-Conditioned Evaluator for Poetry-to-Image Generation

Di cosa parla

Si presenta TangPoetryBench, una raccolta di immagini create per illustrare poesie classiche cinesi e annotate da persone esperte lungo varie dimensioni di qualità — ad esempio aspetto visivo, fedeltà all’immagine evocata dal testo, stile culturale e capacità di trasmettere l’emozione implicita. Insieme viene proposto PoemAutoEvaluator, un valutatore automatico che applica una griglia di criteri per giudicare le illustrazioni e può estendersi a nuovi generatori senza dover riannotare tutto.

Cosa permette di osservare

Consente di chiedersi se le immagini generate colgono l’emozione implicita e la fedeltà culturale di una poesia, e se una valutazione automatica basata su una griglia di criteri umani può integrare il giudizio delle persone su scala.

immaginimodelli linguisticiregolamentazionericerca

Dalla fonte

Text-to-image (T2I) models are increasingly asked to illustrate literary and cultural content, yet we cannot measure how well an image renders the meaning of a poem. The task is many-sided: a good illustration must be visually sound, faithful to the poem's imagery and scene, culturally and stylistically apt, free of spurious text, and true to its emotion, and its deepest requirements, imagery and especially implicit emotion, are never stated in the words. Existing metrics (CLIPScore, BLIPScore, VQAScore) reward literal text-image correspondence and so cannot tell whether an illustration succeeds, let alone why, or even separate the best model from the worst. We introduce TangPoetryBench, a multi-dimensional benchmark of 1,280 images (320 classical Chinese Tang poems x 4 state-of-the-art T2I models) with quality-controlled human annotations across ten dimensions. Analyzing this data, we…