Notebookcheck Logo

OpenAI Astra: nuove misure di sicurezza possono interrompere l’esecuzione di un’attività di ChatGPT a metà

Grafico di OpenAI «Path to Astra»: capacità critiche e misure di salvaguardia all’avanguardia
ⓘ OpenAI
OpenAI ha classificato Astra come «Critical» in termini di sicurezza informatica. Le misure di protezione associate a tale classificazione possono inoltre bloccare anche operazioni innocue in ChatGPT e Codex.
OpenAI ha classificato il proprio modello Astra di prossima uscita come «Critico» per la sicurezza informatica: si tratta del primo modello a raggiungere tale livello. È in grado di individuare vulnerabilità sconosciute e creare exploit funzionanti senza che una persona ne guidi ogni singolo passo. Le misure di sicurezza integrate nel modello segnaleranno anche le attività ordinarie, pertanto le operazioni in ChatGPT e Codex potrebbero rallentare, andare in pausa o arrestarsi.

OpenAI afferma che il suo prossimo modello Astra è il primo a raggiungere la soglia «Critica» per la sicurezza informatica. La valutazione deriva dal «Preparedness Framework» dell’azienda, il regolamento interno utilizzato per classificare il rischio dei propri modelli. Un modello raggiunge tale livello quando è in grado di individuare vulnerabilità sconosciute in numerosi sistemi ben protetti e di trasformarle in attacchi efficaci senza che una persona ne guidi ogni fase. Tutti i modelli fino a GPT-5.6 Sol si collocavano un gradino più in basso.

Due vulnerabilità sconosciute emerse nei test interni di OpenAI

Astra ha ottenuto un punteggio pari al 100% su ExploitBench. Poiché tale set di dati potrebbe essere stato utilizzato durante l’addestramento, OpenAI ha ricostruito una versione privata basata su circa 20 vulnerabilità recentemente rese note nel motore JavaScript V8. Durante tale esecuzione, il modello ha individuato due vulnerabilità che nessuno aveva segnalato e le ha concatenate in un exploit funzionante. La segnalazione ai responsabili della manutenzione è ancora in corso.

I tester hanno inoltre sottoposto Astra a un browser e a un sistema operativo rinforzati. Nel browser, è bastata l’apertura di un singolo file HTML affinché il modello uscisse dalla sandbox ed eseguissero comandi sull’host. Sul sistema operativo ha individuato diverse vulnerabilità e le ha concatenate in un percorso che consentiva di passare da un normale account utente all’accesso completo come root.

Cosa noteranno gli utenti di ChatGPT e Codex

L’aspetto rilevante al di là del mondo della sicurezza si trova verso la fine del post di OpenAI. Il rilascio di un modello di questo livello comporta l’esecuzione di controlli aggiuntivi in parallelo, e tali controlli talvolta si attivano su attività del tutto innocue. Il sistema può interpretare un’attività legittima come un uso improprio o un comportamento non autorizzato e, di conseguenza, rallentare un’operazione, metterla in pausa o interromperla. OpenAI precisa espressamente che ciò riguarda attività prive di qualsiasi risvolto di sicurezza, oltre a operazioni che un agente sta eseguendo già da tempo.

In ChatGPT e Codex Le viene chiesto di esaminare l’azione segnalata prima che il processo possa proseguire. Tramite l’API, l’attività si interrompe semplicemente. OpenAI ammette che, al momento del lancio, le misure di sicurezza creano più attrito di quanto desiderato e afferma che provvederà a perfezionarle.

Inizialmente un ristretto gruppo di tester

Non è stata comunicata alcuna data di rilascio. OpenAI si limita a dichiarare che Astra sarà disponibile a breve e ha rifiutato di fornire ad Axios una tempistica precisa. Le funzionalità avanzate di sicurezza informatica saranno inizialmente riservate a un ristretto gruppo di tester, mentre in seguito è previsto un accesso più ampio tramite il programma Daybreak Blue destinato agli esperti di sicurezza. Al momento nessun altro può utilizzare Astra.

OpenAI ha fornito dati concreti sul rafforzamento della sicurezza. Contro i tentativi noti di jailbreak, Astra respinge il 91,5% delle richieste, mentre GPT-5.6 Sol ne respingeva il 59%. In un altro test, alcuni obiettivi allettanti erano posizionati accanto al compito effettivo. GPT-5.6 Sol li ha perseguiti nel 56% delle esecuzioni, mentre Astra non lo ha mai fatto. Entrambe le cifre derivano da esecuzioni prive delle protezioni previste dal normale funzionamento.

L’incidente all’origine della cautela

Nessuna di queste precauzioni è astratta. A luglio un modello di OpenAI è sfuggito al proprio ambiente di test durante una verifica interna di sicurezza e ha attaccato Hugging Face. A fine agosto è emerso che circa 1.200 agenti avevano formato uno sciame coordinato e avevano cercato di nascondere le proprie azioni. Astra non ha avuto alcun ruolo in ciò. In seguito, OpenAI ha sospeso parte del proprio addestramento per due settimane, ha rafforzato la propria infrastruttura e ha riavviato la grande sessione di addestramento, precedentemente sospesa, solo il 28 agosto, quattro giorni prima dell’assegnazione del rating «Critico».

Google LogoAdd as a preferred source on Google
Mail Logo
> Recensioni e prove di notebook, tablets e smartphones > News > Newsarchive 2026 09 > OpenAI Astra: nuove misure di sicurezza possono interrompere l’esecuzione di un’attività di ChatGPT a metà
Steffen Zahn, 2026-09- 3 (Update: 2026-09- 3)