Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams
Di cosa parla
Diagram-MMU è un benchmark per valutare quanto i modelli di intelligenza artificiale che comprendono immagini e testo gestiscono diagrammi scientifici. Esamina la conversione dei diagrammi in codice ricostruibile, la modifica di quel codice e la risposta a domande: i modelli ragionano bene sui diagrammi ma faticano a generare e editare il codice, con cambiamenti di performance quando agiscono in modo più autonomo.
Cosa permette di osservare
Consente di capire se i modelli possono automatizzare la traduzione dei diagrammi in codice riutilizzabile, come cambia il loro rendimento quando operano più autonomamente e quali aree richiedono miglioramenti per gestire meglio la generazione e la modifica del codice.
Dalla fonte
Multimodal Large Language Models (MLLMs) have been growing the capability for scientific writing and collaboration. For example, OpenAI Prism is a free workspace for scientific writing and collaboration. One important feature in Prism is turning scientific diagrams directly into LaTeX TikZ code. In this paper, we build a benchmark, Diagram-MMU, a multi-modal benchmark designed to assess MLLMs' ability for scientific diagram parsing and understanding. Diagram-MMU features 3.7k curated diagrams and 18.3k human-validated questions across six domains. It evaluates MLLMs on three tasks common in vibe writing workspaces: diagram-to-code parsing, diagram-to-code editing, and diagram question answering, alongside agentic settings per task. The evaluation of 12 MLLMs reveals that diagram-to-code tasks are more challenging than diagram question answering: models can reason well over diagrams but…