AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning

Di cosa parla

Si prende un riassunto generale delle preferenze di un utente — una descrizione in linguaggio naturale usata per personalizzare le risposte — e lo si trasforma in una versione mirata al compito specifico, togliendo informazioni irrilevanti che possono distrarre. Propongono AlignXada, un metodo che impara a riscrivere automaticamente questi profili tramite un processo iterativo basato su feedback linguistico, creando regole di raffinamento riutilizzabili senza richiedere un nuovo addestramento del sistema.

Cosa permette di osservare

Consente di esplorare se è possibile adattare automaticamente i profili personali alle diverse attività per ridurre il rumore informativo e se questa adattabilità dei profili può affiancare altre strategie per agenti personalizzati nel tempo.

agentimodelli linguisticiregolamentazionericerca

Dalla fonte

Natural language user preferences provide an interpretable interface for LLM personalization. However, universal preference summaries often contain information irrelevant to a particular downstream task. Directly supplying the full preference summary therefore wastes context capacity and introduces cross-task distraction, while manually designing task-specific preference views is difficult to scale. In this work, we study \emph{task-specific preference adaptation}: given a universal user preference summary and a downstream task, derive a task-conditioned representation that preserves sufficient decision-relevant evidence while removing redundant context. To this end, we propose \textsc{AlignXada}, a training-free meta-learning framework that induces reusable textual refinement policies for adapting universal preference summaries to task-specific ones. The refinement policy is iterativel…