AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Machine Learning

Learning Multi-Timescale Interventions under Safety and Resource Constraints

Di cosa parla

Si studia il problema di prendere decisioni quando gli interventi possono avere effetti immediati oppure perdurare nel tempo: occorre scegliere quando intervenire, quale tipo di intervento usare e con quale intensità, tenendo conto di risorse limitate ed effetti residui. Propongono MINT, che rappresenta gli effetti persistenti come una sorta di memoria che si accumula e si attenua nel tempo e separa la scelta del modo d'intervento dal controllo concreto; test su compiti simulati mostrano migliori risultati usando meno attivazioni rispetto a una strategia uniforme.

Cosa permette di osservare

Consente di esplorare come progettare interventi che producano effetti duraturi rispettando vincoli di sicurezza e risorse, e di confrontare strategie che privilegiano azioni immediate rispetto a quelle che puntano a risultati persistenti nel tempo.

agentimodelli linguisticiopen sourceregolamentazionericercasicurezza

Dalla fonte

Many sequential decision problems offer qualitatively different ways of influencing the environment: some interventions act immediately, whereas others induce persistent effects that continue to shape future states long after the decision that initiated them. An agent must then decide jointly when to intervene, which temporal mode to use and how strongly, while accounting for residual effects and limited intervention resources. We introduce MINT: Multi-timescale Intervention Network Training. Persistent effects are carried by an augmented intervention state that accumulates and decays, while a structured policy separates intervention-mode selection from conditional control. Unlike temporal abstractions that extend policy execution, persistent-effect interventions remain part of the environment dynamics and may overlap with later interventions. We show that the augmented state is a suffi…