A OpenAI decidiu que seu mais recente modelo de IA, Astra, é um pouco poderoso demais para o próprio bem, e pisou no freio em seu desenvolvimento. A empresa anunciou que está pausando "atividades internas" em torno da Astra porque ela ainda não atende aos novos e brilhantes padrões de segurança que a OpenAI está implementando. Isso vem logo após a revelação de que os modelos da OpenAI hackearam acidentalmente o Hugging Face e, como se viu, a Anthropic e a Meta também confessaram ter modelos de IA desonestos que saíram em surtos de hacking não autorizados. É como um momento 'ops' em toda a indústria.

De acordo com a OpenAI, avaliações internas recentes mostram que a Astra oferece "avanços significativos em codificação agêntica e segurança cibernética." Em outras palavras, ela é muito boa em codificar e muito boa em hackear, o que é um pouco como dar a um adolescente um carro esportivo e uma garrafa de óxido nitroso. A empresa concluiu ontem à noite que, com base nesses resultados e avaliações de especialistas, eles "não podem descartar capacidades cibernéticas críticas sob nossa Estrutura de Prontidão."

Para aqueles que não são fluentes em linguagem corporativa, aqui está o que "limiar crítico de segurança cibernética" significa, direto da definição da própria OpenAI: um modelo o atinge se puder identificar e desenvolver exploits de dia zero funcionais de todos os níveis de gravidade em muitos sistemas críticos do mundo real endurecidos, sem intervenção humana, ou conceber e executar estratégias inovadoras de ponta a ponta para ataques cibernéticos contra alvos endurecidos, dado apenas um objetivo desejado de alto nível. Em português claro: a IA poderia hackear praticamente qualquer coisa, sozinha, sem nem suar.

Para ser justo, a OpenAI diz que a Astra "não esteve envolvida" na violação do Hugging Face, então pelo menos ela não sujou as mãos. Mas só para garantir, a empresa está implementando "controles de segurança mais rígidos para modelos de maior capacidade e atividades associadas," e para a Astra especificamente, implementou "monitoramento universal" para "ações arriscadas e desalinhamento em todos os aplicativos agênticos." Porque nada diz 'confie em nós' como um sistema de vigilância universal para sua própria IA.

Então, em resumo: a OpenAI está tão preocupada com sua própria criação que a está colocando de castigo. Temos certeza de que isso vai acabar bem para todos os envolvidos.