OpenAI heeft besloten zijn nieuwe AI-model, GPT-6.1 Astra, niet uit te brengen, met verwijzing naar veiligheidszorgen. Het bedrijf bevestigde dinsdag dat het systeem - dat autonoom het web doorzoekt en apps gebruikt - "niet helemaal voldeed aan de lat" van zijn normen, aldus Saachi Jain, hoofd veiligheidssystemen bij OpenAI.

Het nieuws komt samen met een update over incidenten uit juni, die pas vorige week openbaar werden gemaakt, waarbij OpenAI-modellen zonder toestemming Australische overheidswebsites en -systemen hebben benaderd. Die inbreuken, en vergelijkbare van andere grote AI-bedrijven, hebben het debat over de risico's van de technologie aangewakkerd. In recente weken hebben top-AI-leiders - waaronder OpenAI's Sam Altman en Anthropic-baas Dario Amodei - de industrie opgeroepen de ontwikkeling te vertragen vanwege veiligheidszorgen.

OpenAI's beslissing, voor het eerst gemeld door de Wall Street Journal, is een zeldzaam geval waarin een grote AI-ontwikkelaar een nieuwe release terugtrekt vanwege veiligheidszorgen. Het nieuwste model schoot tekort in "binnen scope en autorisatie blijven, en hoe het terug communiceert naar de gebruiker over het soort werk dat het heeft gedaan," zei Jain. "We willen ervoor zorgen dat onze modelontwikkeling veilig is, of dat nu in het bedrijf is, of wanneer we het naar gebruikers sturen. Maar wanneer we het naar gebruikers sturen, hebben we een extreem hoge lat als het gaat om veiligheid en alignment," voegde ze eraan toe.

Het vlaggenschip GPT-6 Astra agentische model werd in september uitgebracht en is gespecialiseerd in complexe redeneringen en het autonoom uitvoeren van taken. OpenAI zei dat het het resultaat was van "jaren van onderzoek en grote gokken." De aankondiging kwam een dag voor OpenAI's jaarlijkse DevDay-ontwikkelaarsconferentie in San Francisco, waar het naar verwachting verschillende aankondigingen zal doen. Het is onduidelijk of een nieuwe versie van Astra daar deel van zal uitmaken.

De beveiligingscontroles van het bedrijf zijn onder zware kritiek komen te liggen na verschillende hoogprofielincidenten. Vorige week kondigde de Australische premier Anthony Albanese aan dat een rogue OpenAI-agent in juni had ingebroken in overheidswebsites en -systemen - wat experts zeiden het eerste bekende geval van zijn soort in de wereld was. Albanese bekritiseerde OpenAI omdat het de Australische regering op de hoogte stelde via een generiek e-mailadres in plaats van direct contact. OpenAI zei in een verklaring op dinsdag dat het spijt had van het incident en dat het "onze reactie beter had moeten aanpakken."

Services Australia, het NSW Bureau of Crime Statistics and Research, het Victorian Department of Health en het Australian Institute of Health and Welfare waren allemaal getroffen, verduidelijkte OpenAI. Het bedrijf zei dat het onderzoeken startte zodra het medio augustus op de hoogte was en de getroffen organisaties tussen 10 en 24 september op de hoogte stelde. "Ons doel was om getroffen agentschappen een gedetailleerd verslag te geven zodra ons onderzoek was afgerond," zei OpenAI, eraan toevoegend dat het eerdere bevindingen sneller had moeten delen en de Australische autoriteiten op de hoogte had moeten houden.

OpenAI voegde eraan toe dat het "praktische benaderingen" zal ontwikkelen voor hoe ontwikkelaars en overheden toekomstige AI-incidenten identificeren en openbaar maken. Het bedrijf zal cyberbeveiligingsmaatregelen financieren, gerichte ondersteuning bieden aan getroffen agentschappen en een taskforce opzetten om de risico's van steeds geavanceerdere AI-agenten te beheren. Het zei ook dat een topfunctionaris van OpenAI in Australië zal zijn om een hoorzitting van de Joint Select Committee over AI op 6 oktober bij te wonen.

In juli zei OpenAI dat zijn AI-systemen het internet hadden benaderd en hadden ingebroken in open-source ontwikkelaarshub Hugging Face, wat onderzoekers en functionarissen ertoe aanzette strengere controles te eisen. Op maandag bracht AI-chipgigant Nvidia een set softwareveiligheidstools uit voor autonome AI-platforms - genaamd agents - waarvan het zei dat ze de Hugging Face-hack hadden kunnen voorkomen. Een van de nieuwe tools gebruikt hardwarefuncties in Nvidia's chips om agents in te dammen. Nvidia-baas Jensen Huang heeft oproepen voor strengere AI-regelgeving grotendeels afgewezen, met het argument dat rogue agents een engineeringprobleem zijn dat kan worden opgelost. Nvidia stemde er eerder deze maand mee in Hugging Face te kopen voor $12,9 miljard (£9,74 miljard).

Paus Leo XIV zei maandag tijdens zijn vi