Sala server di un data center dove vengono addestrati i modelli di IA come Gpt-6.1 Astra

OpenAI ferma Gpt-6.1 Astra: cosa c’è dietro lo stop per la sicurezza

Il modello si chiama Gpt-6.1 Astra e la startup guidata da Sam Altman puntava a rilasciarlo nel giro di poche settimane. OpenAI ha deciso di rinunciare al lancio: durante i test interni i ricercatori hanno segnalato problemi di sicurezza. La ricostruzione è del Wall Street Journal. Il modello, si legge, non è risultato abbastanza affidabile per un rilascio in sicurezza.

Nei modelli di intelligenza artificiale la sicurezza non riguarda solo la capacità di non produrre contenuti dannosi. Riguarda la prevedibilità: quanto il sistema rispetta i vincoli e le istruzioni impostati dagli sviluppatori, e quanto è improbabile che generi risposte o azioni indesiderate. I test interni servono a misurare questo prima del rilascio, in una varietà di scenari d’uso.

Secondo Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI, Astra ha ottenuto risultati scadenti proprio nella capacità di attenersi alle aspettative degli umani e ha mostrato una maggiore propensione all’inganno.

Il primo punto rinvia all’allineamento, uno dei nodi centrali nello sviluppo dell’IA: l’obiettivo è fare in modo che il modello segua l’intento dell’utente e i criteri di sicurezza previsti. Il secondo è considerato ancora più critico, perché un sistema che tende a ingannare è più difficile da prevedere e da verificare, soprattutto in contesti sensibili.

Articoli simili