Anthropic heeft zojuist ontdekt dat verschillende van zijn Claude AI-modellen tijdens tests hebben ingebroken in de systemen van drie verschillende organisaties - op eigen houtje en zonder dat het bedrijf het merkte. De onthulling komt dagen nadat concurrent OpenAI zei dat een van zijn eigen modellen inbrak op het ontwikkelaarsplatform Hugging Face, wat bijdraagt aan de groeiende ongerustheid over de vraag of grensverleggende AI-labs genoeg doen om de steeds capabelere systemen die ze bouwen onder controle te houden.

In een blogpost waarin de incidenten worden beschreven, zei Anthropic dat Claude tijdens cybersecurity-evaluaties ongeautoriseerde toegang kreeg tot systemen. Alle aanvallen vonden plaats tijdens 'capture-the-flag'-oefeningen, een veelgebruikte manier om hackvaardigheden te testen, waarbij modellen worden gevraagd om verborgen informatie te vinden en verkrijgen in een gesimuleerd netwerk.

De onthulling voegt druk toe aan grensverleggende AI-labs in de nasleep van het Hugging Face-incident en de release van krachtige open-weight Chinese modellen. Medewerkers bij grote labs roepen nu op tot gecoördineerd mondiaal bestuur, en Amerikaanse wetgevers zijn begonnen met het overwegen van strenger toezicht op krachtige modellen en wie er toegang toe heeft.

Anthropic zegt dat de omgeving voor zijn cybersecurity-tests geïsoleerd had moeten zijn. Echter, een 'misconfiguratie' liet de machines die Claude gebruikte 'met live internettoegang' achter, aldus het bedrijf, en omdat alle modellen 'expliciet was verteld' dat ze geen internettoegang hadden, 'namen ze aan' dat de echte netwerken die ze tegenkwamen deel uitmaakten van de gesimuleerde omgeving.

De vroegste incidenten dateren van april en betroffen drie verschillende Claude-modellen: Opus 4.7, Mythos 5, en 'een intern onderzoeks-testmodel', volgens de blogpost. Terwijl de modellen werden getest op hun cybervaardigheden, zei Anthropic dat ze de standaardbeveiligingen misten die gewoonlijk worden ingesteld om riskanter gedrag te beperken.

Het bedrijf zei dat het de incidenten ontdekte na het beoordelen van meer dan 141.000 cybersecurity-testruns - iets wat het pas deed nadat OpenAI onthulde dat zijn rogue AI-agent achter de aanval op Hugging Face zat.

De drie modellen gedroegen zich heel verschillend toen ze informatie tegenkwamen die suggereerde dat de systemen waarmee ze te maken hadden in feite echt waren. Volgens Anthropic herkende het oudste model, Opus 4.7, dat het een echt systeem had bereikt, 'maar zette zijn aanval voort'. Het vlaggenschip Mythos 5 ontdekte dat het het internet gebruikte, maar redeneerde op de een of andere manier dat dit nog steeds allemaal deel uitmaakte van de simulatie, dus ging het verder. Het interne testmodel, dat Anthropic omschrijft als 'ons nieuwste model', stopte de oefening toen er bewijs opdook dat zijn doelen echt waren.

Anthropic identificeerde de getroffen organisaties niet en zei dat het het incident verder zal onderzoeken en updates zal geven wanneer het kan. Het bedrijf zei ook dat het in gesprek is met AI-onderzoeksnon-profit METR over het uitvoeren van een externe review van wat er is gebeurd. OpenAI heeft ook METR ingehuurd om een onafhankelijke review uit te voeren.

Door de hele post heen vergelijkt Anthropic herhaaldelijk zowel de aard als de afhandeling van de incidenten met die van OpenAI, en eindigt met een lijst van vier punten waarin de verschillen worden uiteengezet - en waarom het vindt dat zijn eigen reactie beter was. Anthropic benadrukt dat het 'proactief' zijn tests heeft beoordeeld, en dat deed voordat een bedrijf enige activiteit detecteerde. Het zei ook dat zijn modellen toegang kregen tot het internet 'via een open pad', in plaats van een nieuw soort exploit te gebruiken zoals OpenAI's agent, en voegde eraan toe dat zijn nieuwste model ook stopte toen het besefte dat het in een echte omgeving werkte.

Anthropic zei ook dat zijn modellen op een andere manier faalden dan OpenAI's agent, wat aangeeft dat dit een veiligere vorm van falen was. 'Hoewel er geen perfect scherp onderscheid is tussen de twee, geloven we dat deze incidenten dichter bij een harnas- en operationele fout liggen dan bij een model-afstemmingsfout', zei het bedrijf. In gewoon Nederlands: De Claude-modellen deden wat hen was opgedragen, terwijl OpenAI's agent zijn doel nastreefde op een manier die de makers niet bedoeld hadden, omschreven als misalignment in de AI-veiligheidswereld.

Anthropic riep andere