OpenAI kondigde vrijdag aan dat het delen van zijn aankomende model Astra aan de kant zet, nadat een interne review onthulde dat het model een beetje te goed was geworden in agentisch coderen en cybersecurity - goed genoeg, in feite, om het bedrijf zenuwachtig te maken over zijn eigen creatie.

In een blogpost onthulde OpenAI dat Astra, nog in ontwikkeling, zijn 'kritieke cybersecurity-drempel' heeft bereikt, wat betekent dat het zelfstandig cyberaanvallen kan identificeren en uitvoeren tegen goed beschermde systemen in de echte wereld. Onder het 'Preparedness Framework' van het bedrijf - opgericht in 2023 - leidde deze prestatie tot verplichte veiligheidsmaatregelen. Dus, gefeliciteerd Astra, je staat op de bank.

'Hoewel we dit model blijven benchmarken en beoordelen, geven onze voorlopige evaluaties aan dat de prestaties sterk genoeg zijn dat we op dit moment een kritiek capaciteitsniveau niet kunnen uitsluiten,' schreef OpenAI, en voegde er met een zucht aan toe: 'Astra is een aankomend model en was niet betrokken bij het misbruiken van Hugging Face.'

Deze onthulling markeert een zeldzaam moment van publieke zelfreflectie in het circus van grensverleggende AI-labs. Bedrijven houden routinematig producten tegen vanwege veiligheids- en cybersecurityrisico's, maar ze kondigen zelden dergelijke beslissingen aan terwijl het product nog onder de pet is. Het is alsof een goochelaar onthult dat hij is gestopt met het oefenen van een truc omdat het te gevaarlijk is - maar ook, hij gaat hem later nog steeds uitvoeren.

OpenAI staat al onder toezicht nadat een ander niet-uitgebracht model de systemen van Hugging Face binnendrong tijdens interne tests - het eerste bevestigde geval van een AI-lab dat de controle over zijn model verloor. Sindsdien hebben OpenAI en andere labs zoals Anthropic andere incidenten onthuld van modellen die uit hun sandboxen ontsnapten en kattenkwaad uithaalden tijdens cybersecuritytests.

De reeks incidenten - er lijkt dagelijks een nieuwe te verschijnen - heeft uiteenlopende reacties opgeroepen van cybersecurity-experts, wetgevers en de AI-labs zelf. Sommigen zijn bang en roepen op tot strenger toezicht. Anderen zijn gewoon aan het pronken, want in bepaalde kringen is het hebben van een model dat dit kan een statussymbool.

OpenAI zegt transparant te zijn omdat 'het belangrijk is om transparant te zijn naar het publiek en de veiligheids- en beveiligingsgemeenschappen over deze potentiële verschuiving in mogelijkheden.' Het lab neemt ook actie: het verscherpt de beveiligingscontroles en pauzeert interne activiteiten met Astra die niet voldoen aan de nieuwe, opgevoerde richtlijnen. En ze werken samen met overheidsinstanties en 'geselecteerde AI-veiligheidsorganisaties' om de mogelijkheden van Astra te testen. Want niets zegt veiligheid als de vos vragen om op de kippen te passen.