Instruction Alignment for Binary Code Representation Learning
Di cosa parla
Si esplora come rendere più accurate le rappresentazioni del codice compilato usate in sicurezza del software e analisi inversa. I metodi attuali colgono relazioni generali tra funzioni ma trascurano corrispondenze minute tra singole istruzioni; gli autori propongono di sfruttare le informazioni di debug del compilatore per allineare le istruzioni durante l’addestramento. Negli esperimenti questo approccio migliora il recupero di funzioni simili e rende i confronti di somiglianza più discriminativi.
Cosa permette di osservare
Permette di capire se insegnare al modello a riconoscere corrispondenze tra singole istruzioni, usando dati di debug già presenti nei binari, può produrre rappresentazioni del codice più precise e più interpretabili.
Dalla fonte
Binary code representation learning is a fundamental problem in software security and reverse engineering. Existing methods mainly learn function-level embeddings that capture coarse-grained semantic relationships between binary functions, but they largely ignore fine-grained instruction-level correspondences. This limitation misses valuable supervision signals available from compiler debug information, which can support the learning of more accurate and interpretable binary code representations. We propose to leverage instruction alignment knowledge to further improve binary code representation learning. Our preliminary study reveals that models finetuned for function-level binary code similarity exhibit substantially better instruction alignment than their pre-trained model, suggesting a strong correlation between instruction alignment and function-level embedding quality. Motivated b…