DORA Explorer: Improving the Exploration Ability of LLMs Without Training
Di cosa parla
Gli agenti basati su grandi modelli di linguaggio faticano a proporre azioni diverse quando devono prendere una serie di decisioni, finendo per ripetere scelte e non esplorare soluzioni migliori. DORA Explorer è un metodo che non richiede riaddestramento e, al momento dell'uso, genera più azioni possibili, le valuta considerando ciascuna azione completa e ne sceglie una tramite un parametro che regola quanto esplorare. Nei test su un problema classico di scelta e su ambienti di avventura testuale, DORA migliora l’esplorazione e aiuta a evitare di restare bloccati in loop.
Cosa permette di osservare
Permette di esplorare se si può ottenere più diversità nelle azioni degli agenti linguistici senza toccare il modello di base e di confrontare la scelta di azioni intere con approcci che creano variazioni solo a livello delle singole parole.
Dalla fonte
Large language model (LLM) agents for sequential decision-making struggle to produce diverse outputs. This leads to insufficient exploration, suboptimal solutions, and repeated actions. Actions are generated at the sequence level, but existing sampling strategies, such as temperature scaling, introduce diversity at the token level, not at the sequence level. We introduce DORA EXPLORER (Diversity-Oriented Ranking of Actions), a training-free, inference-time algorithm for improving exploration in LLM agents. DORA generates multiple candidate actions, scores them using sequence-level log-probability statistics, and samples an action via a tunable exploration parameter. We first study exploration in the classic Multi-Armed Bandit setting, where DORA substantially outperforms temperature-based sampling. Our main evaluation is on the Text Adventure Learning Environment Suite (TALES), where pr…