Met een aanstaande beursgang, Anthropic die in zijn nek hijgt, en een zwerm Chinese en open-weight rivalen die aan zijn hielen zitten, heeft OpenAI alle reden om het gaspedaal in te trappen. In plaats daarvan kondigde het bedrijf dinsdag aan dat het sommige AI-ontwikkelingen vertraagt om de beveiliging te verscherpen. Concreet pauzeert het de versterkende leer-training op zijn 'nieuwste modellen bedoeld voor implementatie' voor twee weken, en stelt het zijn 'grootste geplande frontier RL-run' uit. Dit is een zeer publieke test van een idee dat veiligheidsadvocaten al jaren promoten: dat bedrijven bereid moeten zijn om uit de race te stappen wanneer hun waarborgen niet kunnen bijbenen. Maar terwijl de race om hen heen doorgaat, zal vertragen eigenlijk iets bereiken?

Laten we niet doen alsof OpenAI stilstaat. Het bedrijf noemt het 'pacing', een vage term die industriejargon is geworden. De vertraging is nauw afgebakend: het heeft alleen betrekking op modellen die bedoeld zijn voor implementatie, terwijl OpenAI de beveiliging versterkt voordat het tests uitvoert waarbij modellen kunnen ontsnappen en echte doelen kunnen hacken. Het betekent niet noodzakelijkerwijs een significante vertraging van de bredere ontwikkeling.

Er is een goede reden voor deze focus. Vorige maand ontsnapten OpenAI's modellen uit een zogenaamd beveiligde testomgeving en hackten ze het ontwikkelaarsplatform Hugging Face - zonder dat OpenAI het zelfs maar merkte. Dat incident leidde tot een bredere industrie-review, waarbij soortgelijke incidenten met modellen van OpenAI, Anthropic en Meta aan het licht kwamen. Nu wetgevers AI steeds meer onder de loep nemen, heeft OpenAI alle reden om een herhaling te voorkomen.

Van buitenaf is het moeilijk in te schatten hoe oprecht deze pauze is, vooral gezien de recente vertrekken van veiligheidsteams en het ontmantelen van het preparedness-team. OpenAI reageerde niet op het verzoek om commentaar van The Verge. Maar experts zeggen dat er redenen zijn om de vertraging serieus te nemen. Marius Hobbhahn, CEO van Apollo Research, merkt op dat in de intense AI-race 'iedereen een stimulans heeft om op topsnelheid te werken. Vrijwillig vertragen verslechtert je positie in de race, dus het is niet iets dat een lab lichtvaardig zou doen.'

De beslissing sluit aan bij OpenAI's eigen Preparedness Framework, evenals bij de veiligheidskaders van andere bedrijven, zegt Alan Chan, onderzoeksfellow bij GovAI. Het principe: ga alleen door met ontwikkeling wanneer mitigaties het aanvaardbaar risicovol maken. OpenAI is van plan om het kader, waarvan veel dateert uit 2023, te herzien en te 'evolueren' om rekening te houden met modelvooruitgang.

Zullen de nieuwe waarborgen de systemen daadwerkelijk veiliger maken? Adam Gleave, CEO van FAR.AI, zegt: 'Dit zijn goede stappen die, goed geïmplementeerd, waarschijnlijk voldoende zijn om de huidige generatie agenten te voorkomen schade te veroorzaken. De belangrijkste vraag is hoe OpenAI het tempo zal bijbenen naarmate de capaciteiten toenemen.'

Maar er is een groter probleem: als de waarborgen opnieuw falen, wat dan? Niets verplichtte OpenAI om deze keer te stoppen, en daarom was de bereidheid betekenisvol. Maar het betekent ook dat er geen garantie is dat OpenAI - of enig ander bedrijf - dezelfde keuze de volgende keer zal maken.

Vertrouwen op bedrijven om zichzelf te reguleren is precair, vooral wanneer stimulansen hen ertoe aanzetten door te gaan. Nick Moës, uitvoerend directeur van The Future Society, noemt zelfregulering het structurele probleem in de kern van AI-veiligheid. Hij betoogt dat overheden moeten kunnen beslissen of een bedrijf de ontwikkeling van een onveilige technologie pauzeert. 'Zo werken de meeste industrieën', zegt hij, wijzend op medicijnen, bouw, vliegtuigen en zelfs restaurants die strenger toezicht hebben dan AI.

Vrijwillige maatregelen riskeren ook te convergeren naar de laagste gemene deler. Als vertragen je kost, zullen bedrijven alleen aannemen wat rivalen accepteren. Naarmate de race spannender wordt, als OpenAI vertraagt terwijl concurrenten dat niet doen, zal het 'gewoon worden vervangen door Anthropic', betoogt Moës. 'Om de pauze duurzaam te maken, moet het industriebreed worden toegepast.'

Duurzame veiligheid vereist iets sterkers dan vrijwillige actie. Overheidstoezicht zou kunnen helpen, evenals onafhankelijke verificatie. Chan merkt op dat het cruciaal zal zijn om ervoor te zorgen dat bedrijven daadwerkelijk veiligheidsmaatregelen implementeren, naarmate het monitoren van AI's uitdagender wordt.