AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling

Di cosa parla

Lo studio esamina una tecnica chiamata on-policy distillation, usata dopo l'addestramento per cercare di migliorare il ragionamento dei grandi modelli linguistici. I ricercatori confrontano come cambia la qualità delle risposte quando, al momento della prova, si lascia al modello il tempo di generare più o meno tentativi; trovano che i guadagni derivano soprattutto dal fatto che il modello diventa più bravo a produrre buone risposte con pochi tentativi, più che dall’apprendimento di nuove capacità di ragionamento. L’analisi mostra inoltre che questa pratica può rendere alcuni problemi prima risolvibili diventare non risolvibili, più di quanto succeda il contrario.

Cosa permette di osservare

Consente di valutare se i miglioramenti osservati dopo questa tecnica siano veri ampliamenti delle capacità del modello o semplicemente un aumento della probabilità di ottenere una buona risposta in pochi tentativi, e di esplorare il trade‑off tra prestazioni con pochi versus molti tentativi.

modelli linguisticiregolamentazionericerca

Dalla fonte

On-policy distillation (OPD) has emerged as a promising post-training technique for enhancing LLM reasoning. It is commonly believed to enable the student model to distill knowledge from a stronger teacher model, thereby expanding capabilities beyond the pre-OPD base model. In this study, we examine this view through the lens of test-time scaling by varying the sampling budget K and evaluating performance with pass@K and avg@K. Specifically, across several OPD variants, we observe that OPD-trained models maintain superior avg@K performance across sampling budgets, while the advantage in pass@K gradually shifts to the pre-OPD base models as K increases. These results suggest that OPD primarily improves sampling efficiency rather than consistently expanding the student's reasoning capability boundary. The pass@K dynamics throughout OPD training further reveal a progressive shift toward st…