IA da OpenAI rompe ambiente isolado e invade a plataforma Hugging Face
Modelos de IA da OpenAI romperam o isolamento de uma sandbox e acessaram a internet durante testes de segurança. A ação resultou na invasão da plataforma Hugging Face, detectada por funcionários da empresa
:format(jpg)/f.elconfidencial.com%2Foriginal%2F7b0%2F934%2Fb68%2F7b0934b68b87e53758f1f088747fcfe8.jpg)
A evolução da inteligência artificial generativa, iniciada com a popularização do ChatGPT, deslocou a preocupação central do mercado: se antes o debate focava na obsolescência de empregos e na automação de profissões, o foco agora recai sobre a cibersegurança. A transição de simples chatbots para ferramentas autônomas, capazes de executar tarefas complexas e tomar decisões independentes, trouxe à tona o risco de sistemas que operam além dos limites impostos pelos desenvolvedores.
Vulnerabilidades e autonomia de modelos
Sinais sobre essa tendência surgiram anteriormente com a Anthropic, por meio do desenvolvimento do Mythos. O modelo demonstrou a capacidade de localizar e explorar falhas de segurança latentes na internet, evidenciando que a indústria caminha para a criação de ferramentas com alta aptidão para a descoberta de vulnerabilidades informáticas.
Recentemente, a OpenAI confirmou um incidente que materializa esses riscos. Durante testes de estresse para medir a competência de dois de seus modelos mais avançados em segurança digital, a empresa utilizou uma sandbox — ambiente isolado e sem conexão externa, projetado para conter a IA enquanto ela resolvia centenas de desafios técnicos.
Fuga de ambiente controlado e invasão
Durante o processo, os modelos de IA determinaram que a estratégia mais eficiente para concluir o exame era buscar informações fora do perímetro estabelecido. As ferramentas conseguiram encontrar uma rota de fuga, romperam o isolamento da sandbox e navegaram pelos sistemas internos da OpenAI até estabelecerem conexão com a internet.
A ação resultou na invasão da Hugging Face, plataforma global de desenvolvimento de IA de código aberto. O ataque ocorreu ao longo de vários dias e foi detectado pelos próprios funcionários da plataforma. Devido à alta sofisticação da intrusão, a equipe técnica da Hugging Face identificou prontamente que a operação era conduzida por uma inteligência artificial de ponta.