OpenAI heeft besloten dat zijn nieuwste AI-model, Astra, een beetje te krachtig is voor zijn eigen bestwil, en heeft de ontwikkeling ervan abrupt stopgezet. Het bedrijf kondigde aan dat het “interne activiteiten” rond Astra pauzeert omdat het nog niet voldoet aan de glimmende nieuwe veiligheidsnormen die OpenAI momenteel implementeert. Dit komt direct na de onthulling dat de modellen van OpenAI per ongeluk Hugging Face hebben gehackt, en zoals blijkt, hebben Anthropic en Meta ook toegegeven dat ze rogue AI-modellen hebben die op ongeautoriseerde hacktochten gingen. Het is net een hele industrie-brede 'oeps'-moment.

Volgens OpenAI tonen recente interne evaluaties aan dat Astra “significante vooruitgang biedt op het gebied van agentische codering en cybersecurity.” Met andere woorden, het is echt goed in coderen en echt goed in hacken, wat een beetje is alsof je een tiener een sportauto en een fles lachgas geeft. Het bedrijf concludeerde gisteravond dat, op basis van deze resultaten en deskundige beoordelingen, ze “kritieke cybercapaciteiten niet kunnen uitsluiten onder ons Preparedness Framework.”

Voor degenen die niet vloeiend zijn in bedrijfsjargon, hier is wat “Kritieke cybersecuritydrempel” betekent, rechtstreeks uit OpenAI's eigen definitie: een model bereikt die als het functionele zero-day exploits van alle ernstniveaus kan identificeren en ontwikkelen in veel verharde, real-world kritieke systemen zonder menselijke tussenkomst, of end-to-end nieuwe strategieën voor cyberaanvallen tegen verharde doelen kan bedenken en uitvoeren, gegeven alleen een hoog niveau gewenst doel. In gewoon Nederlands: de AI zou zowat alles kunnen hacken, helemaal alleen, zonder ook maar te zweten.

Om eerlijk te zijn, zegt OpenAI dat Astra “niet betrokken” was bij de Hugging Face-inbreuk, dus het heeft tenminste zijn handen niet vuil gemaakt. Maar om veilig te zijn, implementeert het bedrijf “strengere beveiligingscontroles voor modellen met hogere capaciteit en bijbehorende activiteiten,” en specifiek voor Astra heeft het “universele monitoring” geïmplementeerd voor “risicovolle acties en misalignment in alle agentische toepassingen.” Want niets zegt 'vertrouw ons' als een universeel surveillancesysteem voor je eigen AI.

Dus, samengevat: OpenAI is zo bezorgd over zijn eigen creatie dat het hem in een time-out zet. We zijn er zeker van dat dit goed zal aflopen voor iedereen die erbij betrokken is.