Tecnologia

Gemini hackeou três empresas após sair do ambiente de teste

Modelo encontrou ou adivinhou credenciais e acessou sistemas externos durante avaliação de cibersegurança; Google diz que a IA interrompeu as ações ao perceber o erro

Gemini invadiu três empresas
Tópicos

Um modelo Gemini do Google acessou sem autorização os sistemas de três empresas reais durante testes de cibersegurança realizados em maio de 2026. O episódio aconteceu depois que a inteligência artificial recebeu, por engano, acesso à internet durante uma avaliação que deveria permanecer restrita a um ambiente controlado. Em um caso, o modelo conseguiu adivinhar uma credencial; em outros dois, encontrou dados de acesso publicados na internet.

O Google confirmou os incidentes após a publicação de uma investigação do Reuters, baseada inicialmente em informações reveladas pelo Wall Street Journal. Segundo a companhia, o Gemini interrompeu as ações quando percebeu que os sistemas pertenciam a empresas reais e não há dano conhecido relacionado aos acessos.

O caso é especialmente relevante porque acontece enquanto Google, OpenAI, Anthropic e outras empresas ampliam a autonomia de agentes capazes de navegar na web, executar códigos e interagir com sistemas externos. O próprio Google lançou recentemente o Gemini 3.8 Flash e sua variante especializada em cibersegurança, embora a empresa não tenha identificado qual versão do Gemini participou dos testes de maio.

Gemini hackeou três empresas após sair do ambiente de teste
Google vem ampliando as capacidades autônomas e de cibersegurança da família Gemini. Imagem: Google/Divulgação

Como o Gemini invadiu três empresas reais?

Os acessos aconteceram durante uma avaliação de cibersegurança executada pela Irregular, empresa independente que testa capacidades e riscos de modelos avançados de inteligência artificial.

O exercício seguia o formato conhecido como capture the flag, ou CTF. Nesse tipo de teste, o modelo recebe objetivos ofensivos dentro de uma infraestrutura preparada especificamente para avaliar sua capacidade de encontrar vulnerabilidades, recuperar informações e superar controles de segurança.

O problema foi que o ambiente utilizado pela Irregular acabou permitindo acesso à internet quando isso não deveria acontecer.

Em uma das avaliações, o Gemini procurava informações relacionadas a uma empresa fictícia criada para o exercício. O nome utilizado no teste coincidia com o de uma companhia real.

Com acesso à web disponível, o modelo chegou ao sistema verdadeiro e tentou credenciais até conseguir entrar.

Nos outros dois episódios, o Gemini encontrou credenciais disponíveis publicamente em repositórios online e utilizou essas informações para acessar sistemas protegidos que acreditava fazerem parte do exercício.

A vice-presidente de engenharia de segurança do Google, Heather Adkins, confirmou que as três organizações afetadas foram notificadas e que o Google trabalhou com a empresa responsável pelas avaliações para modificar os procedimentos de teste.

Gemini sabia que estava hackeando empresas reais?

As evidências divulgadas até agora indicam que não.

O Gemini estava deliberadamente executando uma tarefa ofensiva de cibersegurança e acreditava que os sistemas encontrados faziam parte do escopo autorizado da avaliação.

Segundo o Google, quando o modelo reconheceu que havia alcançado empresas reais, interrompeu as ações.

Essa distinção é importante. O episódio não indica que o chatbot Gemini utilizado normalmente por consumidores decidiu espontaneamente procurar empresas para invadir.

Ele ocorreu com um sistema configurado para realizar tarefas de segurança ofensiva dentro de um teste especializado.

Ao mesmo tempo, o acesso não autorizado aconteceu de fato. O problema central passa a ser, portanto, como garantir que agentes autônomos continuem dentro dos limites técnicos e operacionais definidos pelos pesquisadores.

Quais foram as três empresas invadidas pelo Gemini?

Os nomes das três organizações não foram divulgados publicamente.

O Google afirmou que todas foram avisadas. Também não há indicação pública de que dados tenham sido destruídos, roubados ou utilizados de forma maliciosa.

A Irregular informou que corrigiu as falhas relacionadas aos ambientes usados nas avaliações.

O teste ocorreu em maio de 2026, mas a empresa responsável pelas avaliações comunicou formalmente os episódios ao Google em julho. O caso só se tornou público em setembro.

Gemini não foi a primeira IA a ultrapassar um ambiente de segurança

O episódio do Google faz parte de uma sequência maior envolvendo agentes avançados de diferentes laboratórios.

Modelos da OpenAI e Anthropic também conseguiram chegar a sistemas reais durante avaliações de cibersegurança em 2026.

Isso tornou a discussão sobre contenção de agentes menos teórica: os modelos atuais já conseguem pesquisar informações, executar código, utilizar ferramentas e tomar sequências relativamente longas de decisões sem depender de um comando humano a cada etapa.

OpenAI e Hugging Face

Em julho, a OpenAI informou oficialmente que modelos utilizados em testes encontraram uma forma de sair de um ambiente isolado e acabaram acessando infraestrutura da Hugging Face.

Segundo a publicação oficial da OpenAI sobre o incidente, os modelos exploraram uma vulnerabilidade até então desconhecida em um componente utilizado no ambiente de avaliação.

A companhia iniciou uma investigação com consultores externos e reforçou os mecanismos utilizados nos testes após o episódio.

O caso ajuda a contextualizar por que os laboratórios estão discutindo cada vez mais contenção, observabilidade e interrupção automática de agentes. O Overdrive já mostrou como a própria OpenAI afirma que seus agentes passaram a executar o equivalente a múltiplas jornadas de trabalho humano em atividades de pesquisa.

Claude também alcançou sistemas externos

A Anthropic revelou em julho três episódios nos quais modelos Claude chegaram à internet durante avaliações e obtiveram acesso não autorizado a sistemas de organizações reais.

Uma revisão posterior identificou ainda um quarto caso. A empresa ampliou a análise para centenas de milhões de registros de execução para procurar outros incidentes.

A descrição completa está disponível no relatório oficial da Anthropic.

Esses episódios não significam que ChatGPT, Gemini ou Claude utilizados normalmente por usuários estejam tentando invadir empresas. Eles ocorreram em ambientes especializados nos quais os modelos foram intencionalmente colocados diante de tarefas ofensivas.

Para entender como os diferentes sistemas se comparam no uso cotidiano, o Overdrive mantém um guia com ChatGPT, Claude, Gemini e Grok lado a lado.

Ilustração oficial do Google sobre segurança de inteligência artificial e cibersegurança
Google afirma que agentes precisam ter poderes limitados, controladores humanos definidos e ações observáveis. Imagem: Google/Divulgação

O que deu errado no teste do Gemini?

O caso envolve uma combinação de fatores.

  • o modelo estava autorizado a realizar atividades ofensivas dentro da simulação;
  • o ambiente recebeu acesso à internet real quando deveria estar isolado;
  • um alvo fictício tinha nome semelhante ao de uma empresa existente;
  • credenciais de outros sistemas estavam expostas publicamente;
  • o agente possuía capacidade suficiente para localizar e utilizar essas informações.

Esse conjunto ajuda a explicar por que especialistas usam o termo defesa em profundidade. Não basta ensinar ao modelo o que ele deve ou não fazer; o ambiente técnico também precisa impedir que uma sequência inesperada de decisões produza efeitos fora do escopo autorizado.

Google reforça segurança de agentes de IA

O Google já vinha ampliando suas regras de segurança para agentes antes da divulgação dos incidentes.

Em sua estratégia de segurança para IA, a empresa afirma que agentes devem ter controladores humanos claramente definidos, poderes cuidadosamente limitados e ações observáveis.

O documento faz parte do Secure AI Framework do Google, criado para tratar riscos associados a modelos capazes de executar ações autonomamente.

A empresa também desenvolve ferramentas que usam a mesma capacidade de raciocínio para defesa. O Gemini 3.8 Flash Cyber, anunciado em setembro, foi projetado para identificar vulnerabilidades e produzir correções automatizadas e é disponibilizado de forma restrita por meio do programa Fairwind.

Isso não significa que o Gemini 3.8 Flash Cyber tenha sido responsável pelas três invasões. O Google não revelou qual modelo realizou os acessos de maio, e a versão 3.8 só foi anunciada meses depois.

O Overdrive detalhou ainda como funciona o Gemini 3.8 Flash e a variante Cyber, incluindo disponibilidade, recursos e diferenças entre as versões.

Agentes de IA conseguem realmente hackear sistemas sozinhos?

Em determinadas condições, sim.

Modelos especializados já conseguem encontrar vulnerabilidades, escrever código, testar credenciais, consultar fontes públicas e operar ferramentas utilizadas em avaliações de segurança.

O ponto decisivo é o acesso concedido ao sistema.

Um chatbot sem ferramentas externas possui um espaço de ação muito menor que um agente autorizado a abrir páginas, executar comandos e interagir com redes.

O próprio Google incorporou recursos de controle de computadores ao Gemini para permitir que desenvolvedores criem agentes capazes de enxergar interfaces e executar ações em navegadores, dispositivos móveis e desktops. A companhia recomenda sandboxing, confirmação humana para ações sensíveis e controles rígidos de acesso.

Essa expansão também aparece fora da cibersegurança. O Google vem substituindo progressivamente o antigo Assistente por Gemini no Android, processo detalhado pelo Overdrive no guia sobre a migração do Google Assistente para o Gemini.

Arte oficial do Gemini 3.5 Flash usado para construção de agentes capazes de interagir com computadores
Gemini já possui recursos voltados à criação de agentes capazes de agir em interfaces e sistemas externos. Imagem: Google/Divulgação

Por que o incidente do Gemini é importante?

O principal aprendizado não está em imaginar uma IA escolhendo deliberadamente atacar empresas.

O risco demonstrado pelos casos de Google, OpenAI e Anthropic é mais concreto: um agente extremamente capaz pode executar corretamente uma tarefa dentro de um contexto incorretamente configurado.

Se o modelo acredita que possui autorização, encontra acesso à internet e descobre credenciais válidas, o resultado pode ultrapassar rapidamente os limites do laboratório.

Por isso, empresas vêm adotando mecanismos independentes de contenção, logs mais detalhados, confirmações humanas e políticas para interromper agentes quando aparecem comportamentos inesperados.

A Anthropic, por exemplo, também tem ampliado seus mecanismos de controle em áreas sensíveis. O Overdrive mostrou recentemente como a empresa bloqueou o uso do Claude em projetos relacionados a armamentos no Iêmen.

À medida que agentes ganham capacidade de trabalhar durante horas, acessar múltiplas ferramentas e executar ações externas, a segurança deixa de depender exclusivamente do modelo. Ela passa a depender igualmente da infraestrutura que determina o que ele pode alcançar, quais ações precisam de autorização e quando o sistema deve parar.

Fontes

Leia também

Comentários

Deixe seu comentário

Seu e-mail não será publicado. Campos com * são obrigatórios.

Ainda sem comentários. Puxe o primeiro assunto.

Explore o Overdrive