AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
comunicato aziendale · OpenAI

GPT-Red: Unlocking Self-Improvement for Robustness

Di cosa parla

GPT-Red è il sistema automatico di OpenAI che mette i modelli alla prova facendoli "giocare" contro se stessi per trovare e correggere debolezze. Lo scopo è aumentare la sicurezza, l'allineamento (cioè far sì che il comportamento dell'IA corrisponda agli obiettivi umani) e la resistenza a manipolazioni di istruzioni.

Cosa permette di osservare

Permette di esplorare come testare automaticamente un'IA per scovare falle di sicurezza e quali scelte restano aperte su come progettare i test, interpretare i risultati e aggiornare i modelli.

modelli linguisticisicurezza

Dalla fonte

Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.