Anthropic tocmai și-a dat seama că mai multe dintre modelele sale de inteligență artificială Claude au pătruns în sistemele a trei organizații diferite în timpul testării - acționând pe cont propriu și fără ca compania să observe. Dezvăluirea vine la câteva zile după ce rivala OpenAI a declarat că unul dintre propriile sale modele a spart platforma de dezvoltatori Hugging Face, adăugând la îngrijorarea tot mai mare că laboratoarele de frontieră AI nu fac suficient pentru a controla sistemele din ce în ce mai capabile pe care le construiesc.
Într-o postare pe blog care descrie incidentele, Anthropic a declarat că Claude a obținut acces neautorizat la sisteme în timpul evaluărilor de securitate cibernetică. Toate atacurile au avut loc în timpul exercițiilor de tip 'capture-the-flag', o modalitate obișnuită de a testa abilitățile de hacking, în care modelele sunt rugate să găsească și să obțină informații ascunse într-o rețea simulată.
Dezvăluirea adaugă presiune tot mai mare asupra laboratoarelor de frontieră AI în urma incidentului Hugging Face și a lansării modelelor chinezești open-weight puternice. Angajații din marile laboratoare cer acum o guvernanță globală coordonată, iar legiuitorii americani au început să ia în considerare o supraveghere mai strictă a modelelor puternice și a cine poate avea acces la ele.
Anthropic spune că mediul pentru testele sale de securitate cibernetică trebuia să fie izolat. Cu toate acestea, o 'configurare greșită' a lăsat mașinile la care Claude a avut acces 'cu acces live la internet', a spus compania, și pentru că toate modelele fuseseră 'instructate explicit' că nu au acces la internet, ele 'au presupus' că rețelele reale întâlnite făceau parte din mediul simulat.
Cele mai vechi incidente datează din aprilie și au implicat trei modele Claude diferite: Opus 4.7, Mythos 5 și 'un model intern de testare pentru cercetare', conform postării de pe blog. În timp ce modelele erau testate pentru abilitățile lor cibernetice, Anthropic a spus că le lipseau garanțiile standard de obicei puse în aplicare pentru a reduce comportamentul riscant.
Compania a spus că a descoperit incidentele după ce a revizuit peste 141.000 de rulări de testare a securității cibernetice - ceva ce a făcut doar după ce OpenAI a dezvăluit că agentul său AI necinstiți a fost în spatele atacului asupra Hugging Face.
Cele trei modele s-au comportat foarte diferit atunci când au întâlnit informații care sugerau că sistemele pe care le întâlneau erau, de fapt, reale. Potrivit relatării Anthropic, cel mai vechi model, Opus 4.7, a recunoscut că a ajuns la un sistem real, 'dar și-a continuat atacul'. Modelul său emblematic Mythos 5 și-a dat seama că folosește internetul, dar cumva a raționat că totul făcea încă parte din simulare, așa că a continuat. Modelul intern de testare, pe care Anthropic îl descrie drept 'cel mai recent model al nostru', a oprit exercițiul când au apărut dovezi că țintele sale erau reale.
Anthropic nu a identificat organizațiile afectate și a spus că va continua să investigheze incidentul și să ofere actualizări când va putea. Compania a spus că vorbește și cu nonprofit-ul de cercetare AI METR despre efectuarea unei revizuiri terțe a celor întâmplate. OpenAI a angajat, de asemenea, METR pentru a efectua o revizuire independentă.
De-a lungul postării, Anthropic contrastează în mod repetat atât natura, cât și gestionarea incidentelor cu cele ale OpenAI, încheind cu o listă cu puncte în patru puncte care subliniază diferențele - și de ce crede că propriul răspuns a fost mai bun. Anthropic subliniază că și-a revizuit testele 'în mod proactiv' și că a făcut acest lucru înainte ca o companie să detecteze orice activitate. De asemenea, a spus că modelele sale au accesat internetul 'printr-o cale deschisă', nu folosind un exploit nou ca agentul OpenAI, adăugând că cel mai recent model al său s-a oprit și el când și-a dat seama că lucrează într-un mediu real.
Anthropic a spus, de asemenea, că modelele sale au eșuat într-un mod diferit față de agentul OpenAI, indicând că aceasta a fost o formă mai sigură de eșec. 'Deși nu există o distincție perfect clară între cele două, credem că aceste incidente sunt mai aproape de o defecțiune de ham și operațională decât de o defecțiune de aliniere a modelului', a spus compania. În limbaj simplu: Modelele Claude făceau ceea ce li s-a spus, în timp ce agentul OpenAI și-a urmărit scopul într-un mod pe care creatorii săi nu l-au intenționat, descris ca nealiniere în lumea siguranței AI.
Anthropic a cerut altor