AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

VICBench: A Multi-Language Benchmark for Code Vulnerability Detection

Di cosa parla

Hanno creato VICBench: un insieme di esempi costituiti dalle modifiche che per prime introducono una vulnerabilità (VIC). Il benchmark include cento casi verificati presi da 88 progetti in Python, Java e C++, e mostra correzioni e modifiche iniziali più ampie e complesse rispetto ai dataset precedenti. Nei test, gli strumenti automatici attuali individuano solo una parte di queste modifiche, lasciando ancora molto lavoro manuale.

Cosa permette di osservare

Serve a capire quanto gli strumenti oggi scovino davvero le introduzioni iniziali di vulnerabilità in progetti reali e a esplorare quale copertura di linguaggi e quale livello di complessità nelle correzioni siano necessari per migliorarne l’efficacia.

agentimodelli linguisticiregolamentazionericercasicurezza

Dalla fonte

Evaluating security vulnerability detection tools requires benchmark datasets with vulnerability-inducing commits (VICs) - the commits that first introduce vulnerabilities into codebases. VICs are essential for determining the full range of vulnerable software versions. Existing vulnerability datasets suffer from limited programming language coverage, restricted patch complexity, and narrow project scope. Through our dual annotation by human experts and an agentic workflow, we create a benchmark - VICBench - of 100 verified VICs for 100 CVEs across 88 projects in Python, Java, and C++, covering 48 CWE types. VICBench features complex real-world vulnerability fixes averaging 38.6 lines and corresponding VICs of 252.5 lines - significantly larger than prior work. Our evaluation shows that state-of-the-art algorithms V-SZZ and LLM4SZZ achieve only 33.3%-40.1% F1, confirming that using exis…