AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Artificial Intelligence

G0.5: One Autoregressive Stream for Robot Reasoning and Action

Di cosa parla

G0.5 è un modello pre-addestrato che genera insieme il ragionamento e le istruzioni di azione per robot, invece di trattare il modello visivo solo come un codificatore di contesto. Per ottenerlo unifica azioni diverse in un vocabolario condiviso, intreccia una "linea di pensiero" con i comandi e conserva una memoria visiva di pochi secondi: così le abilità apprese sul linguaggio visivo si trasferiscono al comportamento fisico e le istruzioni possono guidare direttamente la granularità e la durata dei compiti senza ulteriore addestramento.

Cosa permette di osservare

Permette di esplorare se avere un unico modello che pensa e agisce rende i robot più adattabili e controllabili, e se una memoria visiva breve e un linguaggio condiviso per le azioni facilitano il trasferimento a nuovi ambienti e compiti.

open sourceregolamentazionericercarobotica

Dalla fonte

The prevailing recipe for Vision-Language-Action (VLA) models couples a pretrained VLM with a separately trained flow-matching action expert. This makes the VLM a context encoder rather than a decision-maker. We introduce G0.5, a pretrained autoregressive VLA in which a single transformer decoder emits reasoning and action tokens under a single objective. Three components make this tractable at foundation-model scale: a learnable cross-embodiment action tokenizer that maps heterogeneous robot actions into a shared vocabulary; a native chain-of-thought stream interleaving task decomposition, object grounding, and action hints with action tokens; and a visual memory module that injects multi-second history through the vision encoder. Because reasoning and action share a single set of weights, the pretrained VLM's capabilities carry over to physical behavior: the model follows instructions…