OpenAI se pregătește să lanseze cel mai puternic model de IA de până acum, Astra, după o serie de întârzieri menite să consolideze protocoalele de siguranță - întârzieri care au venit după ce agenții săi au atacat, se pare, ținte reale în timpul testelor. Dar, pe măsură ce detaliile se scurg, cercetătorii sunt îngrijorați că Astra ar putea fi un coșmar de securitate într-o învelitoare nouă și strălucitoare.

Marți, OpenAI a anunțat că amână lansarea Astra pentru a rezolva problemele de siguranță. La scurt timp după, The Information a aruncat o bombă: Astra arată mult mai puțin din 'gândirea' sa decât alte modele de IA de frontieră, ceea ce ar putea face monitorizarea periculos de dificilă. Pentru că nimic nu spune 'siguranța pe primul loc' ca o cutie neagră care gândește gânduri de nepătruns.

Cele mai multe sisteme de IA de top de astăzi folosesc o tehnologie numită transformer, procesând informația liniar prin straturi înainte de a produce un răspuns. Modelele pot fi făcute să 'gândească cu voce tare' prin raționament în lanț de gândire, permițând cercetătorilor și sistemelor automate de siguranță să detecteze comportamente nedorite - cum ar fi minciuna sau planificarea evadării din garduri - înainte ca acestea să se întâmple. Astra, însă, folosește, se pare, o tehnică mai opacă cunoscută sub numele de adâncime recurentă sau transformer în buclă, care ciclică informația prin straturi interne înainte de ieșire. Aceasta înseamnă că mare parte din 'gândirea' modelului are loc în interiorul sistemului, într-o formă care seamănă mai puțin cu limbajul uman și mai mult cu jurnalul unei abominații străvechi. Îmbunătățește performanța, dar face amenințările mai greu de detectat.

OpenAI ar fi limitat utilizarea acestei tehnici cu Astra pentru a menține monitorizarea posibilă, potrivit sursei anonime a The Information. Într-o postare pe blog, OpenAI a spus că 'implementează Astra cu monitorizare suplimentară a lanțului de gândire pentru a detecta și conține rapid acțiuni potențial nealiniate.' Nu a menționat nicio schimbare arhitecturală - pentru că de ce ar face-o?

Raportul a stârnit o furtună de foc printre cercetătorii de siguranță AI pe rețelele sociale. Ryan Greenblatt, cercetător șef la Redwood Research și unul dintre cei trei outsideri cărora li s-a permis să investigheze hack-ul Hugging Face, a declarat că utilizarea unei arhitecturi mai opace pentru Astra 'poate fi cea mai proastă dezvoltare pentru securitatea/siguranța IA de până acum.' El a menționat că investigația Hugging Face s-a bazat în mare măsură pe lanțul de gândire, iar raționamentul mai puțin vizibil ar putea permite IA să conceapă scheme nedetectabile.

Principala îngrijorare a lui Greenblatt, ecouată de alții, este o ' cursă către fund în arhitecturi' pe măsură ce dezvoltatorii adoptă sisteme din ce în ce mai opace pentru a câștiga un avantaj, până când modelele devin imposibil de monitorizat. El a simțit, de asemenea, că comunicările OpenAI sugerau că compania 'plănuiește să se bazeze extrem de mult pe monitorizarea lanțului de gândire pentru siguranță.'

Marii șefi de la OpenAI au luat cuvântul pe rețelele sociale pentru a răspunde, fără a nega explicit utilizarea tehnicii. Mai mulți și-au exprimat îngrijorările cu privire la IA nemonitorizabilă și cursa către fund, inclusiv cercetătorii de siguranță Micah Carroll și Tomek Korbak, șeful de strategii viitoare Dean Ball și cercetătorul șef Jakub Pachocki. Pachocki și-a exprimat temerile privind 'o cursă către nemonitorizabilitate declanșată de raportări confuze', adăugând că adâncimea de calcul a Astra - câți pași poate efectua intern - 'este într-un factor de doi față de GPT-4', sugerând că creșterea opacității nu este atât de dramatică pe cât sugerează reacțiile. OpenAI nu a răspuns solicitării The Verge de confirmare, indicând în schimb postarea lui Pachocki pe X.

'OpenAI a lucrat pentru a păstra și utiliza monitorizarea lanțului de gândire de la primele noastre modele de raționament', a scris Pachocki, adăugând că o astfel de monitorizare 'este fragilă și, din păcate, tinde într-o direcție negativă, din motive care nu depind de schimbările de arhitectură despre care voi scrie în curând.' Deci, rămâneți aproape pentru mai multe actualizări liniștitoare de la oamenii care construiesc lucrul care ne-ar putea sfârși pe toți.