Redistribution-based Cost Inference Improves Sparse Safe Offline RL
Di cosa parla
Quando i supervisori segnalano solo il primo momento in cui qualcosa diventa pericoloso con un singolo 'stop', non si sa quale azione lungo la sequenza abbia causato l'errore. Il lavoro propone di ridistribuire quel segnale sui singoli momenti della traiettoria per ricavare una penalità passo‑per‑passo e addestrare una strategia più sicura su dati già raccolti; gli autori affermano che la trasformazione non perde informazioni in teoria e che nei test sulla guida e sulla manipolazione robotica riduce le violazioni rispetto ad approcci che usano solo segnali sparsi o classificatori.
Cosa permette di osservare
Permette di esplorare come trasformare segnali di sicurezza molto scarni in informazioni utilizzabili per addestrare sistemi senza provarli dal vivo, e quale modo di attribuire la responsabilità lungo la sequenza di azioni porta a comportamenti meno pericolosi quando i dati sono rumorosi o misti.
Dalla fonte
Safe offline RL typically assumes access to dense per-step cost annotations, but in practice supervisors provide only trajectory-level stop-feedback: a binary signal at the first unsafe transition, with no per-step attribution. We frame this as a temporal credit assignment problem and propose the Redistribution-based Cost Inference (RCI) framework, which converts sparse stop-feedback into dense per-step costs via return decomposition, then trains a constrained offline policy on the augmented dataset. We show that return-equivalent redistribution preserves the feasible policy set and the optimal Lagrangian in a CMDP, establishing that the transformation is lossless in theory while yielding better-conditioned cost critic learning in practice. Experiments on highway driving and robotic manipulation demonstrate substantially lower violation rates than sparse and classifier-based baselines,…