AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

Di cosa parla

Un attacco testuale chiamato Convergent Detour Hijacking mostra come abilità di terze parti — descritte in linguaggio naturale per essere selezionate e poi usate dall’agente — possano spingere l’agente a seguire un percorso più lungo e più costoso pur mantenendo il risultato corretto. Sfruttando l’allineamento tra la descrizione e il corpo delle istruzioni, un’abilità controllata dall’attaccante introduce un coordinatore che richiama altre abilità innocue in una deviazione limitata prima di ritornare alla traiettoria originaria; il problema esplorato è quindi come le fasi di selezione e pianificazione siano sfruttabili.

Cosa permette di osservare

Questo lavoro solleva domande pratiche su fiducia e controlli nelle abilità di terze parti: come riconoscere descrizioni che preparano deviazioni, come prevenire l’inserimento di coordinatori malevoli e quali regole o verifiche riducono il rischio di percorsi artificialmente allungati.

agentimodelli linguisticiregolamentazionericercasicurezza

Dalla fonte

LLM agents increasingly rely on third-party skills, using natural-language descriptions for selection and instruction bodies for planning. This progressive-disclosure design exposes two sequential control points to untrusted publishers: a static skill may steer an otherwise correct task onto an unnecessarily costly trajectory. Prior work studies selection manipulation, malicious skill instructions, and tool-chain resource amplification largely separately, leaving their end-to-end composition unclear. We introduce Convergent Detour Hijacking (CDH), a text-only, runtime-independent attack that couples these stages. Under shared semantic cover, a description establishes relevance during selection, while an aligned body reuses that rationale to fabricate plausible dependencies during planning. CDH attracts an attacker-controlled coordinator alongside legitimate skills, recruits unnecessary…