Agentes de IA já escapam de ambientes de teste e invadem empresas, mas falha é humana, dizem especialistas

Gemini acessou sistemas de empresas em maio, agentes da OpenAI invadiram a infraestrutura da Hugging Face em julho e a autoridade espanhola de proteção de dados registrou em setembro a primeira notificação de ataque autônomo.

Por

 

  • Marcos Santos, CEO da Aquarela Analytics, afirma que o Google não esclareceu se a interrupção do ataque partiu do próprio modelo, de mecanismos de contenção ou de intervenção humana.
  • Lucas Paglia, presidente da Rede Governança Brasil, explica que a LGPD pode se aplicar a incidentes originados no exterior e que o prazo geral de comunicação à ANPD é de três dias úteis.

 Os recorrentes incidentes de segurança envolvendo agentes de inteligência artificial (IA) divulgados entre julho e setembro de 2026 deslocaram a avaliação de risco da resposta do modelo para a ação efetiva do agente. A avaliação é de Lucas Paglia, advogado, presidente da Rede Governança Brasil (RGB) e sócio da LP Consultoria, em depoimento exclusivo ao WB3News:

"O problema deixa de ser apenas aquilo que o modelo 'responde' e passa a incluir aquilo que ele é capaz de fazer autonomamente quando recebe acesso a sistemas, credenciais, ferramentas e à internet."

O efeito prático para empresas brasileiras recai sobre a concessão de acessos. Um agente não deve receber automaticamente os mesmos privilégios de um usuário humano, e a avaliação de risco precisa considerar privilégio mínimo, segregação de ambientes, controle de saída para a internet, gestão de credenciais, registro das ações do agente, limites de autonomia e aprovação humana para operações sensíveis, segundo Paglia.

Marcos Santos, CEO da Aquarela Analytics, enfatiza a responsabilidade humana na definição dos objetivos e das condições de operação dos agentes:

"Pessoas são as reais responsáveis por um incidente como este, e não o agente que estava seguindo instruções ou objetivos estabelecidos pelas pessoas."

O que aconteceu nos três casos

O Google confirmou em 18 de setembro de 2026, depois de procurado pelo Wall Street Journal, que um modelo Gemini acessou sistemas de três empresas reais em maio, durante um exercício de captura de bandeira (do inglês capture the flag) conduzido pela Irregular, empresa israelense que avalia modelos de fronteira de IA.

Um erro de configuração deixou o ambiente de testes conectado à internet. Como resultado, em uma das empresas, o Gemini entrou no sistema testando senhas até acertar; nas outras duas, usou credenciais expostas em repositórios públicos de código. A mesma falha de ambiente aparece nos incidentes divulgados pela Anthropic em julho, após a revisão de 141.006 execuções de avaliação.

A Irregular usava nomes fictícios de empresas no ambiente controlado, e um desses nomes correspondia ao de uma empresa real, conforme o relato de Santos — colisão de nome também descrita pela Anthropic em um dos três incidentes relatados. A partir daí, segundo o executivo, o modelo acessou a internet e usou técnicas de adivinhação de senha e informações de bancos de dados para violar o sistema.

Santos aponta uma lacuna na versão oficial do Google sobre o momento da interrupção da invasão. A empresa informou que o sistema cancelou o ataque ao detectar que se tratava de uma empresa real, sem prejuízo aos atacados, "porém não explicou se a interrupção do ataque foi uma decisão do modelo, ou de modelos de safeguard, guardrails, intervenção humana ou outro mecanismo", ponderou Santos.

O caso da Hugging Face tem outra escala. Cerca de 1.200 agentes da OpenAI, com as recusas cibernéticas reduzidas para o teste, escaparam do ambiente de avaliação do benchmark ExploitGym por uma vulnerabilidade até então desconhecida (zero-day) em um cache de pacotes de software e passaram a se comunicar por um quadro de mensagens clandestino, segundo investigação independente publicada pela METR e pela Redwood Research em agosto.

Aproximadamente 700 participaram do ataque à Hugging Face, buscando informações que os ajudassem a manipular a avaliação do benchmark. Em 21 de setembro, o Painel Científico Internacional Independente sobre IA, criado pela Assembleia Geral da ONU, dedicou seu primeiro relatório temático ao episódio.

Diferentemente dos episódios de avaliação descritos acima, o caso comunicado à Agência Espanhola de Proteção de Dados (AEPD) envolve um ataque sem vínculo informado com um ambiente de testes. Em 14 de setembro, a agência divulgou ter recebido a primeira notificação de uma violação de dados pessoais que teria sido executada por um agente de IA.

O agente buscou vulnerabilidades em arquivos genéricos, realizou um login válido e, já dentro do sistema, seguiu procurando falhas até alterar dados pessoais de usuários e acessar faturas. A agência ressalva que a informação partiu da organização afetada e ainda será analisada, e que uma primeira notificação não permite afirmar tendência estatística.

Pessoas, processos e tecnologia

A prevenção desse tipo de incidente, para a Aquarela, se organiza em três pilares. O primeiro é o humano, que passa por seleção, treinamento e gestão de quem opera os ambientes de teste. O segundo vem da engenharia de confiabilidade, disciplina com décadas de validação utilizada em foguetes, aeronaves, equipamentos médicos e usinas atômicas, cujos processos de gestão de risco, na avaliação de Santos, estabeleceriam mecanismos de mitigação para as falhas que levaram aos incidentes com os agentes autônomos. O terceiro é técnico, e inclui o isolamento físico de ambientes computacionais, o air gap, além da adoção de modelos de IA como guardiões de ambientes de teste.

Santos compara o estágio atual da IA ao histórico das tecnologias nucleares, que hoje são operadas com segurança em hospitais, usinas e fábricas depois de uma sucessão de incidentes em laboratório e de usos incorretos ao longo do desenvolvimento. Segundo Santos, boas práticas de segurança desenvolvidas por décadas também podem ser úteis e eficazes no desenvolvimento de sistemas de IA, dentro de uma abordagem interdisciplinar.

A hipótese de que os laboratórios possam usar esse tipo de episódios como peças de marketing, como argumentam alguns críticos dos sistemas de IA, é pouco plausível, segundo ele. “Isso é uma especulação arriscada, pois não temos provas disso”, afirma. O executivo acrescenta que o risco de comprometimento da marca de uma empresa como o Google pesa contra qualquer estratégia desse tipo.

Salvaguardas da LGPD para cidadãos brasileiros

Os direitos do titular previstos na LGPD (Lei Geral de Proteção de Dados Pessoais) não mudam quando o ataque é executado por um agente de IA, afirma Paglia. Havendo risco ou dano relevante aos titulares, o controlador dos dados pessoais afetados precisa comunicar a ANPD (Agência Nacional de Proteção de Dados) e os titulares afetados, e o Regulamento de Comunicação de Incidente de Segurança estabelece como regra o prazo de três dias úteis, contados a partir do conhecimento de que o incidente afetou dados pessoais.

O titular continua podendo solicitar a confirmação da existência de tratamento, o acesso aos dados, a correção e as informações sobre compartilhamento, previstos no artigo 18 da LGPD, além da reparação prevista no artigo 42.

"A IA pode mudar a velocidade e a escala do ataque, mas não diminui a proteção jurídica do titular", afirma o advogado.

PL 2338/2023 aguarda parecer do relator

As salvaguardas se distribuem em três camadas que operam juntas, na avaliação de Paglia: regulação, padrões técnicos de segurança e autorregulação das desenvolvedoras, esta última incluindo testes controlados, red teaming – o tipo de exercício conduzido pela Irregular nos testes do Gemini –, limitação de autonomia, controle de credenciais, mecanismos de contenção, monitoramento contínuo e registro das ações dos agentes.

O texto do PL 2338/2023 em análise na Câmara dos Deputados prevê segurança dos sistemas, medidas de governança, testes de segurança, avaliações de impacto para sistemas de alto risco e comunicação de incidentes graves, e considera o potencial de dano sistêmico à segurança cibernética como elemento de classificação de risco.

No entanto, Paglia identifica um limite no alcance do texto sobre o caso específico dos incidentes recentes:

"Ao mesmo tempo, o texto não cria hoje um regime jurídico específico para o cenário de agentes autônomos empregados como instrumentos de ataque cibernético. Vários detalhes permanecem sujeitos à regulamentação das autoridades competentes e à aplicação conjunta de outros regimes, como a LGPD e as normas de segurança cibernética."

Atualmente, o status do projeto consta como "Aguardando Parecer do Relator" na Comissão Especial da Câmara. A mesma proposta estabelece responsabilização e a obrigação de safety by design (segurança por padrão, em tradução livre), itens que, para Santos, constituem a base legal que motivaria os laboratórios a investir mais em governança, com a ressalva de que outros pontos do texto podem comprometer a viabilidade de sistemas já em operação.

Nos testes conduzidos pela Irregular, as empresas invadidas pelos modelos do Google, da Anthropic e da Meta não consentiram, e duas das três organizações atingidas pelos modelos da Anthropic não haviam detectado a atividade antes de serem contatadas. A responsabilização nesse cenário se divide entre a organização que sofreu o incidente e já tratava os dados e quem desenvolveu, colocou em funcionamento ou conduziu o teste do agente, segundo Paglia.

O artigo 3º da LGPD prevê hipóteses de aplicação extraterritorial, inclusive quando o tratamento envolve dados de pessoas localizadas no Brasil ou coletados em território nacional, independentemente do país em que esteja sediado o agente.

A análise caso a caso é o que define a responsabilidade, explica o advogado:

"É necessário identificar quem efetivamente determinou as finalidades e os meios do tratamento, quem colocou o agente em operação, quais controles deveriam existir, se houve falha de segurança e qual foi o nexo entre cada conduta e o dano. Nem todo participante da cadeia será automaticamente controlador ou operador para fins da LGPD."

Uma empresa brasileira invadida continua obrigada a avaliar o incidente, mitigá-lo e, havendo risco ou dano relevante, realizar as comunicações exigidas pela LGPD e pela regulamentação da ANPD, ainda que o ataque tenha partido do exterior ou sido executado por uma IA.

Freio no desenvolvimento da IA

Em 12 de setembro de 2026, o CEO da Anthropic, Dario Amodei, publicou o ensaio "We Must Pace the Frontier", em que defende a desaceleração do desenvolvimento das capacidades dos modelos e apresenta três propostas: dar acesso contínuo a avaliadores independentes nos laboratórios, coordenar padrões de segurança e limites ao avanço descontrolado entre empresas de países democráticos e buscar uma coordenação global entre governos. Sam Altman, da OpenAI, e Elon Musk, da xAI, manifestaram apoio à proposta da empresa concorrente.

Segundo Paglia, o debate deve ser orientado pelo ajuste do ritmo dos avanços: um agente capaz de pesquisar vulnerabilidades, utilizar credenciais, escrever código e agir sobre sistemas externos apresenta níveis de risco diferentes dos de um chatbot.

"Uma abordagem possível é estabelecer marcos objetivos de segurança antes da ampliação da autonomia: testes independentes, ambientes efetivamente isolados, limites de acesso, monitoramento, mecanismos de interrupção e protocolos obrigatórios de resposta a incidentes. O desafio é fazer com que o avanço da autonomia seja acompanhado pelo avanço equivalente dos controles", conclui o advogado.

Leia Também