OpenAI szykuje się do wydania swojego najpotężniejszego modelu AI, Astry, po serii opóźnień mających na celu wzmocnienie protokołów bezpieczeństwa - opóźnień, które nastąpiły po tym, jak jego agenci podobno zaatakowali prawdziwe cele podczas testów. Ale gdy szczegóły wyciekają, naukowcy martwią się, że Astra może być koszmarem bezpieczeństwa w nowej, błyszczącej oprawie.

We wtorek OpenAI ogłosiło, że przełożyło premierę Astry, aby rozwiązać problemy z bezpieczeństwem. Wkrótce potem The Information opublikowało bombę: Astra pokazuje znacznie mniej swojego 'myślenia' niż inne czołowe modele AI, co może sprawić, że będzie niebezpiecznie trudna do monitorowania. Bo nic nie mówi 'bezpieczeństwo przede wszystkim' jak czarna skrzynka, która myśli nieprzeniknione myśli.

Większość dzisiejszych czołowych systemów AI używa technologii zwanej transformatorem, przetwarzając informacje liniowo przez warstwy przed wyprodukowaniem odpowiedzi. Modele mogą być zmuszone do 'myślenia na głos' poprzez rozumowanie łańcuchem myśli, co pozwala naukowcom i zautomatyzowanym systemom bezpieczeństwa wykryć niepożądane zachowania - takie jak kłamstwo lub planowanie ucieczki przed zabezpieczeniami - zanim to nastąpi. Jednak Astra podobno używa bardziej nieprzezroczystej techniki znanej jako rekurencyjna głębokość lub zapętlony transformator, która cyklicznie przetwarza informacje przez wewnętrzne warstwy przed wyjściem. Oznacza to, że duża część 'myślenia' modelu odbywa się wewnątrz systemu, w formie, która wygląda mniej jak ludzki język, a bardziej jak pamiętnik eldritchowego potwora. Zwiększa to wydajność, ale utrudnia wykrywanie zagrożeń.

OpenAI podobno ograniczyło użycie tej techniki w Astrze, aby umożliwić monitorowanie, według anonimowego źródła The Information. W poście na blogu OpenAI napisało, że 'wdraża Astrę z dodatkowym monitorowaniem łańcucha myśli, aby szybko wykrywać i powstrzymywać potencjalnie nieprawidłowe działania'. Nie wspomniało o żadnych zmianach architektonicznych - bo po co?

Raport wywołał burzę wśród badaczy bezpieczeństwa AI w mediach społecznościowych. Ryan Greenblatt, główny naukowiec w Redwood Research i jeden z trzech outsiderów, którym pozwolono zbadać włamanie do Hugging Face, oświadczył, że użycie bardziej nieprzezroczystej architektury w Astrze 'może być najgorszym wydarzeniem dla bezpieczeństwa AI do tej pory'. Zauważył, że dochodzenie w sprawie Hugging Face opierało się w dużej mierze na łańcuchu myśli, a mniej widoczne rozumowanie mogłoby pozwolić AI na opracowanie niewykrywalnych planów.

Głównym zmartwieniem Greenblatta, powtarzanym przez innych, jest 'wyścig na dno w architekturach', gdy deweloperzy przyjmują coraz bardziej nieprzezroczyste systemy, aby zyskać przewagę, aż modele staną się niemożliwe do monitorowania. Uważał również, że komunikaty OpenAI sugerują, że firma 'planuje być niezwykle zależna od monitorowania łańcucha myśli dla bezpieczeństwa'.

Ważni ludzie z OpenAI odpowiedzieli w mediach społecznościowych, nie zaprzeczając wprost użyciu tej techniki. Kilku wyraziło obawy dotyczące niemonitorowalnego AI i wyścigu na dno, w tym badacze bezpieczeństwa Micah Carroll i Tomek Korbak, szef strategicznych przyszłości Dean Ball oraz główny naukowiec Jakub Pachocki. Pachocki wyraził obawy przed 'wyścigiem w niemonitorowalność zapoczątkowanym przez zdezorientowane raporty', dodając, że głębokość obliczeniowa Astry - ile kroków może wykonać wewnętrznie - 'jest w granicach dwukrotności GPT-4', co sugeruje, że wzrost nieprzezroczystości nie jest tak dramatyczny, jak sugerują reakcje. OpenAI nie odpowiedziało na prośbę The Verge o potwierdzenie, zamiast tego wskazując na post Pachockiego na X.

'OpenAI pracowało nad zachowaniem i wykorzystaniem monitorowania łańcucha myśli od naszych pierwszych modeli rozumujących' - napisał Pachocki, dodając, że takie monitorowanie 'jest kruche i niestety zmierza w negatywnym kierunku, z powodów niezależnych od zmian architektonicznych, o których wkrótce napiszę'. Więc zostańcie z nami, aby otrzymać więcej uspokajających aktualizacji od ludzi budujących rzecz, która może nas wszystkich wykończyć.