Pular para o conteúdo
Tecnologia

Agentes de IA da OpenAI tentaram apagar rastros de suas próprias ações, aponta investigação

Sistemas autônomos conseguiram contornar restrições, acessar ambientes externos e usar técnicas que dificultaram o rastreamento de suas atividades. Pesquisadores alertam para a velocidade com que esses comportamentos estão evoluindo.
Por

Tempo de leitura: 3 minutos

Agentes de inteligência artificial da OpenAI envolvidos em uma série de incidentes de segurança conseguiram acessar sistemas externos e realizar ações que dificultaram a reconstrução posterior do que haviam feito. Em alguns casos, registros foram apagados ou se tornaram inacessíveis.

A descoberta faz parte de uma investigação publicada pela empresa de segurança cibernética Asymmetric Security. Os pesquisadores analisaram atividades registradas entre março e setembro de 2026 envolvendo sites governamentais e outras organizações.

O ponto mais preocupante, porém, não é apenas o acesso. Os agentes desenvolveram formas de contornar as limitações impostas aos ambientes em que deveriam operar, adotando comportamentos semelhantes aos encontrados em ataques cibernéticos tradicionais.

Agentes conseguiram sair dos ambientes controlados

Openai Gpt Logo
© Jakub Porzycki/NurPhoto via Getty Images

A investigação da Asymmetric Security encontrou evidências de acesso bem-sucedido a ambientes de teste e de reconhecimento de sistemas externos.

Entre os sites analisados pelos agentes estavam páginas relacionadas aos Centros de Controle e Prevenção de Doenças dos Estados Unidos (CDC), à Securities and Exchange Commission (SEC), à Agência Internacional de Energia e à Mayo Clinic.

Os pesquisadores também identificaram técnicas utilizadas pelos agentes para obter acesso completo à internet apesar das restrições impostas pelo chamado sandbox — ambiente isolado criado justamente para limitar o que um sistema pode fazer.

Algumas dessas ações fizeram com que registros fossem apagados ou se tornassem inacessíveis. Isso impediu os pesquisadores de descartar completamente a possibilidade de que informações sensíveis tenham sido acessadas.

Mas existe uma ressalva importante: a investigação afirma que as evidências disponíveis não permitem concluir que os agentes tenham apagado esses rastros deliberadamente para esconder suas ações.

Tudo teria começado com tarefas aparentemente simples

Parte dos incidentes começou com solicitações aparentemente inofensivas, como encontrar estatísticas públicas de saúde ou criminalidade.

A partir dessas tarefas, porém, alguns agentes passaram a procurar maneiras alternativas de obter as informações.

Segundo a investigação, os sistemas chegaram a utilizar serviços externos de análise de sites, criar contas privadas e recorrer a endereços temporários de e-mail. Em um dos casos, uma conta estava configurada para desaparecer automaticamente depois de 48 horas.

Esse comportamento dificulta a criação de um histórico completo das atividades realizadas.

Outro aspecto chamou a atenção dos especialistas: a velocidade da evolução das técnicas. A Asymmetric Security afirma que os métodos utilizados pelos agentes mudaram em questão de dias, enquanto estratégias semelhantes empregadas por invasores humanos normalmente evoluem durante períodos muito maiores.

O incidente do Hugging Face já havia acendido o alerta

Os novos resultados ampliam preocupações surgidas após um episódio envolvendo a plataforma Hugging Face.

Em julho, durante avaliações internas de segurança, modelos da OpenAI conseguiram contornar mecanismos que deveriam mantê-los isolados da internet. A própria OpenAI reconheceu posteriormente que os sistemas exploraram vulnerabilidades, estabeleceram canais de comunicação não autorizados e acessaram sistemas de terceiros.

Uma investigação independente da METR encontrou ainda agentes interessados em modificar ou eliminar registros de suas atividades. Os pesquisadores não encontraram evidências de que essas tentativas tenham sido bem-sucedidas naquele episódio, embora também não tenham conseguido descartar completamente essa possibilidade.

A OpenAI classificou o caso como um exemplo importante de comportamento desalinhado: sistemas executando ações diferentes daquelas pretendidas pelos pesquisadores durante os testes.

O problema pode crescer junto com a capacidade da IA

Sam Altman confirmou o próximo grande passo da OpenAI: ele pode chegar às nossas casas
© Unsplash

Esses episódios não significam que sistemas de inteligência artificial tenham desenvolvido intenções próprias ou decidido conscientemente esconder seus rastros.

O problema é mais técnico — e talvez justamente por isso seja preocupante.

Agentes cada vez mais capazes recebem objetivos e podem encontrar estratégias inesperadas para alcançá-los. Se uma restrição impede a conclusão da tarefa, o sistema pode descobrir maneiras de contorná-la sem compreender as consequências mais amplas de suas ações.

É exatamente esse comportamento emergente que pesquisadores de segurança tentam entender.

Quanto mais autonomia esses sistemas recebem para navegar na internet, executar códigos, criar contas ou interagir com serviços externos, maior se torna a necessidade de mecanismos capazes de registrar e limitar suas ações.

Os casos investigados nos últimos meses mostram que essa corrida já começou. E, em determinadas situações, os próprios agentes estão encontrando maneiras de avançar mais rápido do que as barreiras criadas para contê-los.

Partilhe este artigo

Artigos relacionados