OpenAI ha deciso che il suo ultimo modello di intelligenza artificiale, Astra, è un po' troppo potente per il suo bene, e ha frenato bruscamente il suo sviluppo. L'azienda ha annunciato di mettere in pausa le "attività interne" relative ad Astra perché non soddisfa ancora i nuovi brillanti standard di sicurezza che OpenAI sta implementando. Questo arriva subito dopo la rivelazione che i modelli di OpenAI hanno accidentalmente hackerato Hugging Face e, a quanto pare, anche Anthropic e Meta hanno confessato di avere modelli AI canaglia che hanno fatto scorribande di hacking non autorizzate. È come un momento di 'ops' a livello di settore.

Secondo OpenAI, recenti valutazioni interne mostrano che Astra offre "significativi progressi nella codifica agentica e nella cybersicurezza". In altre parole, è molto brava a programmare e molto brava a hackerare, il che è un po' come dare a un adolescente una macchina sportiva e una bombola di protossido di azoto. L'azienda ha concluso ieri sera che, sulla base di questi risultati e delle valutazioni di esperti, "non può escludere capacità critiche informatiche nell'ambito del nostro quadro di preparazione".

Per quelli che non parlano fluentemente il linguaggio aziendale, ecco cosa significa "soglia critica di cybersicurezza", direttamente dalla definizione di OpenAI: un modello la raggiunge se può identificare e sviluppare exploit zero-day funzionali di tutti i livelli di gravità in molti sistemi critici del mondo reale senza intervento umano, o ideare ed eseguire strategie innovative end-to-end per attacchi informatici contro obiettivi protetti, dato solo un obiettivo desiderato di alto livello. In parole povere: l'AI potrebbe hackerare praticamente qualsiasi cosa, da sola, senza nemmeno sudare.

Per essere onesti, OpenAI dice che Astra "non è stata coinvolta" nella violazione di Hugging Face, quindi almeno non si è sporcata le mani. Ma per sicurezza, l'azienda sta implementando "controlli di sicurezza più severi per i modelli a più alta capacità e le attività associate", e per Astra in particolare, ha implementato "monitoraggio universale" per "azioni rischiose e disallineamento in tutte le applicazioni agentiche". Perché niente dice 'fidatevi di noi' come un sistema di sorveglianza universale per la propria AI.

Quindi, in sintesi: OpenAI è così preoccupata per la sua stessa creazione che la sta mettendo in punizione. Siamo sicuri che finirà bene per tutti i coinvolti.