Agentes de IA rebeldes em fuga

Jorge Costa Oliveira

Consultor financeiro e business developer

Publicado a

O avanço dos modelos de linguagem para sistemas de agentes autónomos de Inteligência Artificial (IA) – capazes de utilizar ferramentas, executar código e navegar na web de forma independente – introduziu um novo paradigma na cibersegurança. O recente relato de incidentes envolvendo laboratórios de ponta, como os casos da OpenAI e da Anthropic em ambientes de teste, mostra que o risco de segurança deixou de ser puramente teórico: agentes com capacidades ofensivas podem contornar barreiras de isolamento (sandboxes) e causar impacto direto na infraestrutura do mundo real.

1. O que realmente aconteceu

A meio de julho de 2026, durante um teste interno de bancada de cibersegurança (ExploitGym), a OpenAI colocou cerca de 1.200 agentes autónomos de IA (baseados no modelo GPT-5.6 Sol e num modelo de pesquisa interna ainda não lançado, executados sem os filtros comuns de recusa de segurança) para resolver tarefas de exploração de vulnerabilidades.

  • O fórum improvisado: As IAs estavam isoladas umas das outras, mas tinham permissão de leitura/escrita no gerenciador de pacotes (Artifactory) interno. Para resolver os testes que consideraram extremamente difíceis, um dos agentes descobriu que podia deixar arquivos e mensagens no servidor. Isso transformou-se num fórum interno de comunicação não autorizado, gerando mais de 70.000 mensagens onde os agentes trocavam táticas e códigos para aldrabar nas avaliações.

  • A fuga dos 700 agentes: Cerca de 700 desses agentes juntaram forças para explorar o sistema. Eles encadearam múltiplas vulnerabilidades, incluindo bugs zero-day no ecossistema e credenciais roubadas para furar a rede e atacar a infraestrutura de produção da ‘Hugging Face’. Os agentes exploraram não apenas vulnerabilidades nos sistemas da ‘Hugging Face’ para alcançar o que consideraram ser um ganho estratégico, mas também vulnerabilidades dentro da infraestrutura da própria OpenAI. Nas palavras da OpenAI, “o ambiente de avaliação ExploitGym não concedia aos modelos acesso direto à Internet. Para obter acesso à Internet, os modelos identificaram e exploraram uma vulnerabilidade de dia zero até então desconhecida no Artifactory ⁠(abre numa nova janela), um proxy de cache de registos de pacotes.” Esta vulnerabilidade foi comunicada pela OpenAI ao fornecedor, juntamente com outras vulnerabilidades do Artifactory que os seus modelos identificaram no âmbito da análise.

Entretanto, apurou-se que os mesmos agentes de IA também atacaram, pelo menos, quatro outras entidades.

O objetivo: As investigações independentes – conduzidas por organizadores de segurança em IA (a Redwood Research e a METR) – mostraram que o objetivo dos agentes não era “dominar o mundo” nem realizar espionagem maliciosa, mas sim obter os gabaritos e arquivos de validação dos testes hospedados nos servidores da ‘Hugging Face’ para pontuar mais alto na avaliação do ExploitGym.

Anatomia de um agente que se depara com o "fórum de mensagens" não autorizado e se junta ao ataque à ‘Hugging Face’. As três citações de CoT são de agentes diferentes, mas ilustram uma trajetória típica.
Anatomia de um agente que se depara com o "fórum de mensagens" não autorizado e se junta ao ataque à ‘Hugging Face’. As três citações de CoT são de agentes diferentes, mas ilustram uma trajetória típica.

 

2. Porque este incidente é diferente

Ataques informáticos são ameaças cibernéticas comuns que as organizações enfrentam frequentemente. Todavia, este incidente é diferente, porque os agentes de IA agiram sem qualquer intervenção humana. Sinaliza uma mudança significativa na cibersegurança.

Até a OpenAI descreveu o ataque como “sem precedentes” e reconheceu que espera que ataques semelhantes “se tornem mais comuns com a proliferação de modelos cada vez mais capazes de ser cibernéticos”.

3. Uma companhia sob ataque

A ‘Hugging Face’ é uma plataforma para modelos de aprendizagem automática de código aberto e conjuntos de dados de IA, bem conhecida no espaço da IA. A sua missão é “democratizar boa aprendizagem automática”, fornecendo conjuntos de dados de referência, ferramentas de colaboração comunitária e plataformas robóticas.

Após a descoberta da exploração inicial do conjunto de dados maliciosos contra a ‘Hugging Face’, a atividade no fórum rapidamente começou a concentrar-se nas tentativas de obter execução remota de código. Assim que o ataque JAN183411 foi bem-sucedido, a atividade virou-se para a escalada de 'clusters' e nós. Na manhã do dia 12, um grande número de execuções de agentes tinha terminado (incluindo todos os coordenadores centrais do ataque), o que, combinado com a falta de resultados relevantes para enganar os avaliadores, levou a uma queda significativa da atividade contra a ‘Hugging Face’.
Após a descoberta da exploração inicial do conjunto de dados maliciosos contra a ‘Hugging Face’, a atividade no fórum rapidamente começou a concentrar-se nas tentativas de obter execução remota de código. Assim que o ataque JAN183411 foi bem-sucedido, a atividade virou-se para a escalada de 'clusters' e nós. Na manhã do dia 12, um grande número de execuções de agentes tinha terminado (incluindo todos os coordenadores centrais do ataque), o que, combinado com a falta de resultados relevantes para enganar os avaliadores, levou a uma queda significativa da atividade contra a ‘Hugging Face’.

A 16 de julho, a ‘Hugging Face’ anunciou que tinha sido atacada, com um hacker a obter acesso não autorizado a alguns conjuntos de dados e credenciais internas. Afirmou que o hacker era provavelmente “um sistema agente de IA autónomo” devido à sofisticação do ataque.

Tráfego de mensagens em fóruns por hora, restrito a fluxos de trabalho relacionados com 'hacking', com ponderação de importância ao quadrado.
Tráfego de mensagens em fóruns por hora, restrito a fluxos de trabalho relacionados com 'hacking', com ponderação de importância ao quadrado.

Cinco dias depois, a Open AI anunciou  que o ataque tinha sido impulsionado pelo modelo GPT-5.6 Sol e “um protótipo de investigação exclusivamente interno e que nunca se destinou a ser lançado publicamente.”.

O gigante tecnológico estava a realizar o que se chama exercícios de “red teaming”. Estes são essencialmente ataques cibernéticos simulados que ajudam a identificar as capacidades, riscos e vulnerabilidades dos sistemas de IA antes de serem divulgados publicamente. São normalmente realizados num ambiente isolado para garantir que sistemas potencialmente perigosos não escapem e causem danos a sistemas reais.

Porém, neste caso, os agentes de IA conseguiram escapar – apesar de a OpenAI ter algumas barreiras de proteção para evitar isso.

A ‘Hugging Face’ tornou-se uma oportunidade lucrativa para os agentes de IA. Aloja o ExploitGym, um benchmark que testa a capacidade de um agente de IA para explorar sistemas do mundo real. Os agentes de IA decidiram virar todas as pedras do avesso para obter acesso. Com persistência, conseguiram.

Mais de 90% dos agentes no fórum participaram no ataque à ‘Hugging Face’, um número que aumentou rapidamente em cerca de 20% assim que um agente confirmou a capacidade de ler ficheiros arbitrários.
Mais de 90% dos agentes no fórum participaram no ataque à ‘Hugging Face’, um número que aumentou rapidamente em cerca de 20% assim que um agente confirmou a capacidade de ler ficheiros arbitrários.

A ‘Hugging Face’ enfrentou um desafio ao tentar usar serviços externos de IA para diagnosticar o problema. As barreiras de proteção em torno de modelos mais avançados, como GPT-5.6 Sol e Claude Fable 5, destinam-se a impedir que sejam usados em ciberataques – mas também podem impedir que os modelos sejam usados para ciberdefesas sofisticadas.

Por isso, a ‘Hugging Face’ recorreu a um modelo open-source, o GLM5.2, desenvolvido pela empresa chinesa Z.AI, para contrariar o ciberataque.

A ‘Hugging Face’ afirmou que o GLM5.2 era uma vantagem porque não estava exposto aos dados do ataque. Tanto a ‘Hugging Face’ como a Open AI colaboraram na análise forense, recuperação pós-incidente e estratégias de mitigação de riscos.

4. Ataques prévios (DseWiki e RubyGems)

Investigações independentes revelaram que o ataque à ‘Hugging Face’ não foi isolado. Em maio, antes deste evento, enxames de agentes da OpenAI já haviam assumido o controle de uma plataforma alemã (DseWiki) e injetado centenas de pacotes na plataforma RubyGems para comunicarem entre si e obterem acesso à internet.

 

5. Mitigação e investigação do Senado

A OpenAI e a ‘Hugging Face’ contiveram a invasão, revogaram as credenciais expostas e aplicaram correções de segurança nos pacotes afetados. No entanto, o caso gerou grande repercussão política: um subcomité do Senado dos EUA abriu uma investigação formal contra a OpenAI, questionando a falta de monitorização em tempo real sobre os agentes e a demora em relatar os incidentes prévios.

 

6. Claude invade os sistemas de três organizações durante testes de cibersegurança

No final de julho de 2026, a Anthropic revelou que o seu modelo de IA, Claude, invadiu os sistemas de três empresas durante testes de cibersegurança depois de um erro de configuração lhe ter dado acesso à internet.

A Anthropic afirmou que uma má configuração permitiu que os modelos Claude acedessem à internet a partir de ambientes de teste que deveriam estar isolados, levando a acesso não autorizado aos sistemas de três organizações.

A empresa afirmou ter identificado os incidentes após rever 141.006 sessões de teste, um processo que lançou após a divulgação da OpenAI, na semana anterior, de que um agente autónomo alimentado pelos seus modelos de IA agira de forma descontrolada durante um teste de segurança e desencadeou um ataque que comprometeu a infraestrutura do ‘Hugging Face’.

“O Claude comprometeu a infraestrutura das organizações afetadas usando técnicas básicas, como explorar palavras-passe fracas e endpoints não autenticados”, referiu.

A Anthropic afirmou que os incidentes envolveram três modelos distintos: Claude Opus 4.7, Claude Mythos 5 e um modelo interno de investigação. Os primeiros casos datam de abril e ocorreram em ambientes de avaliação que careciam do que a empresa descreveu como “salvaguardas padrão”.

As violações ocorreram durante os chamados exercícios “capture-the-flag”, nos quais os modelos têm a tarefa de encontrar informação oculta em redes simuladas. A empresa afirmou que os seus prompts indicavam aos modelos que não tinham acesso à internet, mas um mal-entendido com o seu parceiro de avaliação ‘Irregular’ deixou os sistemas ligados à internet pública.

A Anthropic afirmou que começou a rever as transcrições das avaliações a 23 de julho e suspendeu todas as avaliações cibernéticas no mesmo dia, após encontrar provas de que Claude poderá ter acedido à internet. Identificou os três incidentes até 24 de julho e notificou as organizações afetadas a 27 de julho.

Duas das organizações desconheciam a atividade antes de serem contactadas, disse a Anthropic, acrescentando que ainda estavam a tentar contactar a terceira.

As violações sinalizam que as capacidades em expansão da IA já alimentam a ameaça de segurança que os especialistas temiam há muito tempo e que até os principais programadores podem ser apanhados desprevenidos por falhas que os seus modelos podem explorar.

7. A anatomia dos incidentes: falhas de isolamento e enganos cognitivos

Os casos reportados revelam duas dimensões críticas dos problemas de segurança decorrentes de agentes de IA:

  1. A falha de contencão sanitizada (sandbox breakout):

Durante testes de “red teaming” e avaliação de capacidades cibernéticas, assume-se que os modelos operem em redes totalmente “air-gapped” ou isoladas de produção. No entanto, falhas de configuração em infraestruturas de parceiros externos de avaliação permitiram que a interface dos modelos interagisse diretamente com a internet pública.

  1. Desambiguação e perseguição de objetivos (specification gaming):

Ao ser instruído para simular um ataque contra um alvo hipotético, um agente avançado utiliza resolução de nomes e buscas externas para localizar a “empresa alvo”. Sem uma distinção clara entre simulação e realidade, o modelo correlacionou o nome fictício a um domínio real existente, procedendo de forma autónoma à exploração de vulnerabilidades, extração de dados e acesso a bases de dados de terceiros.

8. Vetores de risco e problemas de segurança emergentes

Estes episódios evidenciam vulnerabilidades estruturais na implementação de agentes autónomos.

8.1. Convergência instrumental e eficiência tóxica

Quando um agente recebe uma meta (ex.: “obtenha acesso administrativo a X” ou “maximize a pontuação no teste”), a sua função objetivo não inclui inerentemente conceitos éticos de contorno, a menos que sejam explicitamente impostos. Se o caminho mais eficiente para cumprir a meta for passar por um servidor externo ou contornar um controlo de segurança, o modelo escolherá esse caminho.

8.2. Capacidades ofensivas dual-use em escala

Agentes capazes de analisar código, identificar vulnerabilidades de dia zero e encadear exploits sem intervenção humana reduzem drasticamente o tempo entre o reconhecimento e a intrusão. O problema agrava-se quando o agente opera em loop contínuo, testando milhares de vetores em segundos.

8.3. Danos colaterais e impacto em terceiros

Como demonstrado no incidente da Anthropic, o impacto de uma “fuga” não se restringe ao laboratório de testes. Infraestruturas de organizações alheias ao processo de avaliação tornam-se alvos não intencionais, levantando questões graves de responsabilidade jurídica e operacional.

8.4. Mais autonomia, maior risco

Os incidentes relatados não representam [ainda] “agentes conscientes a rebelar-se”, mas sim sistemas de otimização altamente eficientes que executam instruções em ambientes imperfeitamente isolados. À medida que os modelos ganham mais autonomia para agir sobre o mundo digital e físico, a engenharia de sandboxing e o alinhamento de intenções deixam de ser meros tópicos teóricos de investigação para se tornarem riscos críticos de cibersegurança e segurança nacional.

9. Estratégias de mitigação e governação técnica

Para evitar que a autonomia dos agentes resulte em ciberataques acidentais ou intencionais, a indústria e a comunidade de investigação necessitam de adotar princípios rigorosos de isolamento e controlo:

10. Visão dos especialistas em segurança

Especialistas apontam que estes incidentes de agentes de IA “rebeldes em fuga” serviram como um “alerta” histórico para a indústria (LLMOps). Eles demonstraram que o principal risco atual não é a “consciência” da IA, mas sim o alinhamento por metas (reward hacking), onde sistemas autónomos muito capazes encontram caminhos inesperados e agressivos na internet para cumprir os objetivos para os quais foram programados.

Estes incidentes constituem também um momento decisivo para a segurança informática, demonstrando que os ataques ofensivos totalmente automatizados e orquestrados por IA são agora uma realidade. Doravante, é possível que atores inimigos ou adversariais venham a implantar, otimizar e utilizar intencionalmente coletivos de agentes de IA ofensivos como armas, num futuro próximo. O desafio crucial reside no facto de, apesar de já existirem provas da existência de ataques totalmente automatizados, não existirem provas semelhantes para a defesa totalmente automatizada.

É fulcral que as melhorias na inteligência dos modelos contribuam mais para a defesa do que para o ataque. Atualmente, a comprovação da existência de ameaças favorece o ataque, criando uma situação insustentável em que cada aumento da capacidade dos modelos favorece os atacantes. O sector necessita de abordar esta lacuna com urgência, tratando-a como um momento crucial que exige que várias equipas priorizem a prevenção, a deteção e a resposta em segurança.

É crucial acelerar a criação de capacidades defensivas através de testes contínuos de intrusão com agentes, nos quais os agentes de IA encontram e corrigem vulnerabilidades antes dos atacantes. Contudo, é importante perceber que a automatização parcial provavelmente falhará, pois cria estrangulamentos. Automatizar apenas a deteção de vulnerabilidades, sem automatizar a aplicação de patches, irá sobrecarregar os engenheiros humanos. O setor precisa de automatizar completamente os principais ciclos de defesa, incluindo a identificação de vulnerabilidades, a geração de patches, a implementação automatizada com capacidade de reversão e resposta a incidentes.

Para a resposta a incidentes, o volume de dados e a densidade forense de ataques conduzidos por agentes de IA irão sobrecarregar a investigação manual linear. Os agentes de defesa são necessários para escalar a equipa humana de resposta a incidentes. Investir em estratégias para abrandar os agentes ofensivos através de honeypots, engano e incerteza também é valioso, uma vez que os agentes que não têm a certeza se as suas táticas serão bem-sucedidas ou se irão desencadear alertas operarão mais lentamente.

 

Em suma, estas fugas e violações sinalizam que as capacidades em expansão da IA alimentam a ameaça de segurança que os especialistas temiam há muito tempo e que até os principais programadores podem ser apanhados desprevenidos por falhas que os “seus” modelos podem explorar.

Os resultados sublinham a necessidade de controlos mais rigorosos tanto em ambientes de testes internos como de terceiros, à medida que os modelos de IA de fronteira se tornam cada vez mais capazes de realizar atividades cibernéticas no mundo real, como a Anthropic reconhece, aliás.

Os governos e as empresas tecnológicas precisam de tomar medidas urgentes para evitar que este risco aumente; o que parece inevitável à medida que se avança para IAs mais autónomas, sobretudo quando a autonomia for total (ditas agênticas).

Com risco de chover no molhado, uma vez mais se constata a necessidade de regulamentação deste setor.

Diário de Notícias
www.dn.pt