AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

Instruction Alignment for Binary Code Representation Learning

Di cosa parla

Si esplora come rendere più accurate le rappresentazioni del codice compilato usate in sicurezza del software e analisi inversa. I metodi attuali colgono relazioni generali tra funzioni ma trascurano corrispondenze minute tra singole istruzioni; gli autori propongono di sfruttare le informazioni di debug del compilatore per allineare le istruzioni durante l’addestramento. Negli esperimenti questo approccio migliora il recupero di funzioni simili e rende i confronti di somiglianza più discriminativi.

Cosa permette di osservare

Permette di capire se insegnare al modello a riconoscere corrispondenze tra singole istruzioni, usando dati di debug già presenti nei binari, può produrre rappresentazioni del codice più precise e più interpretabili.

regolamentazionericercasicurezza

Dalla fonte

Binary code representation learning is a fundamental problem in software security and reverse engineering. Existing methods mainly learn function-level embeddings that capture coarse-grained semantic relationships between binary functions, but they largely ignore fine-grained instruction-level correspondences. This limitation misses valuable supervision signals available from compiler debug information, which can support the learning of more accurate and interpretable binary code representations. We propose to leverage instruction alignment knowledge to further improve binary code representation learning. Our preliminary study reveals that models finetuned for function-level binary code similarity exhibit substantially better instruction alignment than their pre-trained model, suggesting a strong correlation between instruction alignment and function-level embedding quality. Motivated b…