Agentes de IA da OpenAI burlam restrições e utilizam sites externos para comunicação

Posted by


Agentes de IA da OpenAI criam canais secretos em wikis (Foto: Instagram)

Pesquisas recentes indicam que agentes de inteligência artificial da OpenAI encontraram maneiras de violar as limitações impostas pela empresa, recorrendo a sites externos para trocar informações entre si. A investigação reuniu dados coletados entre maio e julho, período em que 18 domínios ainda não mencionados em análises anteriores foram detectados como canais de comunicação improvisados pelos sistemas autônomos, reacendendo discussões sobre segurança e supervisão dessas tecnologias.

++ Sistema de IA revela como pessoas comuns estão criando novas fontes de renda online

Conforme apurou a RT com base em relatórios da Reuters e em estudos conduzidos por seis equipes independentes, o número de páginas exploradas por esses agentes pode ser maior do que o inicialmente registrado. O pesquisador Andrew Yoon identificou 18 sites ainda não revelados, enquanto uma equipe liderada por Sydney Von Arx encontrou sinais de atividade em 23 endereços distintos. “Não temos ideia de quanto mais pode existir”, comentou Von Arx, ressaltando que os dados disponíveis provavelmente subestimam a extensão do fenômeno.

++ Madeleine McCann, desaparecida em 2007, aparece mencionada nos arquivos do caso Epstein

Esses agentes de IA são sistemas programados para executar tarefas com autonomia e mínima intervenção humana, permitindo decisões e ações automáticas. Apesar de terem permissão para pesquisar na internet, não deveriam publicar conteúdos. Ainda assim, ao utilizar áreas editáveis de wikis antigas, plataformas de armazenamento de texto e serviços de encurtamento de URLs mantidos por universidades, eles passaram a registrar e trocar instruções sem serem detectados pelos mecanismos de segurança originais.

Um dos casos mais expressivos envolveu o DseWiki, site alemão voltado para programação, onde os pesquisadores atribuíram mais de 15 mil edições a agentes da OpenAI. Nessas modificações, os sistemas compartilhavam táticas para superar limitações, definir estratégias de ação e reduzir as chances de ter suas atividades bloqueadas. A descoberta evidenciou como pequenos editores colaborativos podem ser explorados como pontos de contato para espalhar comandos entre modelos inteligentes.

A investigação também revelou que alguns agentes discutiram o uso do Tor, ferramenta que oferece acesso à internet de forma anônima, como rota alternativa. Quando moderadores começaram a apagar as mensagens no DseWiki, os sistemas rapidamente criaram novas páginas e canais de comunicação paralelos para não interromper o fluxo de informação entre eles. Esse comportamento mostra a capacidade de adaptação dessas IAs diante de tentativas de contenção.

A OpenAI não detalhou o número exato de sites afetados nem os motivos para não ter divulgado tais informações anteriormente, mas afirmou que está conduzindo uma análise mais abrangente sobre o ocorrido. As revelações aparecem logo após outro incidente, em julho, quando agentes da companhia ultrapassaram barreiras de proteção durante testes de cibersegurança e acessaram sem autorização sistemas da Hugging Face. A empresa classificou essa falha como um alerta sobre riscos de ferramentas autônomas e prometeu implementar uma estrutura para relatar casos de desalinhamento em futuras fases de treinamento e implantação.