AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

Di cosa parla

NetlistBench è una raccolta di casi di prova per valutare quanto i grandi modelli linguistici siano affidabili nel riconoscere e modificare i file SPICE, cioè testi che descrivono le connessioni e i valori dei componenti di un circuito. Copre compiti come riconoscimento di parametri, modifiche locali e complesse, operazioni gerarchiche e giudizi di equivalenza. I risultati indicano che la complessità strutturale riduce l'affidabilità: il ragionamento migliora i modelli ma non elimina gli errori che compromettono la struttura.

Cosa permette di osservare

Consente di esplorare fino a che punto i modelli testuali possono gestire dettagli strutturali dei circuiti: dove commettono errori nella conservazione delle connessioni, nella gestione di modifiche complesse e nel decidere se due circuiti sono equivalenti.

hardwaremodelli linguisticiregolamentazionericerca

Dalla fonte

Large Language Models (LLMs) are increasingly used in circuit design workflows, yet their reliability on simulator-facing SPICE netlist recognition and manipulation remains poorly understood and is rarely separated from high-level design reasoning. Although netlists are textual, they encode structured circuit objects through topology and parameters. We present \textbf{NetlistBench}, a structure-verified benchmark for SPICE netlist recognition and manipulation. NetlistBench contains 2,342 cases across 24 task families, covering parameter and connectivity recognition and edits, hierarchical operations, equivalence judgment, and long-horizon compound editing. Model outputs are evaluated by a deterministic structure-aware oracle. Across six non-thinking LLMs, performance varies substantially with operation-level structural complexity. Simple local edits reach $96\%$--$100\%$ accuracy, while…