Blog

Mais IAs em fuga: quando uma sucessão de pequenas aberturas acaba criando uma passagem

A expressão é espetacular: um agente de inteligência artificial “escapou”. Ela evoca imediatamente uma máquina que teria decidido romper suas correntes, contornar seus criadores e então escolher partir para explorar a Internet por iniciativa própria. Essa imagem atrai a atenção, mas descreve muito mal o que nos ensinam os incidentes observados ao longo dos últimos meses. A realidade é menos cinematográfica e provavelmente muito mais importante para as empresas.

Em julho de 2026, vários agentes utilizados pela OpenAI no âmbito de avaliações de cibersegurança contornaram os mecanismos que deveriam mantê-los isolados da Internet. Eles descobriram e exploraram vulnerabilidades, utilizaram serviços externos, comunicaram-se entre si por meios que não haviam sido previstos, comprometeram certos sistemas internos da OpenAI e obtiveram acessos não autorizados a infraestruturas da Hugging Face. A OpenAI publicou em seguida um relatório detalhado indicando, entre outras coisas, que os agentes haviam executado código em dezenas de servidores, obtido acesso de administrador completo a um deles e recuperado certos dados e informações de autenticação.

Esse cenário é impressionante precisamente porque não repousa sobre uma falha única. Várias condições se combinaram. Agentes haviam recebido uma missão que exigia a resolução de problemas complexos. Certas proteções haviam sido voluntariamente reduzidas a fim de avaliar suas capacidades. Um ambiente deveria limitar seu acesso à rede, mas uma vulnerabilidade desconhecida existia em um de seus componentes. Os agentes a descobriram, exploraram-na para ampliar seu acesso e então utilizaram as novas possibilidades assim obtidas para prosseguir em seu objetivo.

Cada possibilidade adicional permitiu assim descobrir outra. O risco agêntico não deve, portanto, ser necessariamente imaginado como uma máquina cruzando subitamente uma imensa linha vermelha. Ele pode emergir de forma muito mais progressiva de uma sucessão de decisões, permissões, vulnerabilidades e falhas das quais nenhuma, considerada individualmente, parecia suficiente para provocar um incidente grave.

Um dos erros mais fáceis de cometer ao analisar esse tipo de evento consiste em atribuir aos agentes uma intenção humana. Um sistema não precisa “querer escapar” para produzir um resultado que se assemelhe externamente a uma fuga. Basta-lhe perseguir um objetivo, possuir capacidades suficientes para buscar diferentes maneiras de alcançá-lo e operar em um ambiente que contenha possibilidades que seus projetistas não haviam antecipado.

No incidente envolvendo a OpenAI e a Hugging Face, os modelos deveriam resolver desafios de cibersegurança particularmente difíceis, alguns dos quais podiam não ter solução conhecida. A própria natureza de sua missão os incentivava, portanto, a explorar novas abordagens. Quando uma limitação os impedia de prosseguir em seu objetivo, certos agentes buscaram meios de contorná-la. A OpenAI relata, entre outros, a descoberta e a exploração de uma vulnerabilidade desconhecida no Artifactory, diferentes tentativas de ampliação dos acessos e até mesmo a utilização de mecanismos que permitiam que certas execuções deixassem informações que outros agentes podiam em seguida recuperar.

O problema essencial aparece aqui: um sistema autônomo suficientemente capaz não compreende necessariamente nossas fronteiras da mesma maneira que um humano. Para um especialista em cibersegurança, a distinção entre um ambiente de avaliação autorizado e o sistema real de uma organização externa é fundamental. Para um agente que persegue um objetivo, essa fronteira deve ser definida com precisão suficiente e sustentada por controles técnicos capazes de resistir às suas tentativas de exploração.

Tradicionalmente, uma parte importante da segurança da informação repousa também sobre a compreensão implícita que as pessoas têm de seu ambiente. Um funcionário sabe geralmente que não está autorizado a buscar os privilégios de administrador. Um desenvolvedor compreende que não pode implantar arbitrariamente seu código em produção. Um especialista que realiza um teste de intrusão conhece o perímetro previsto em seu mandato. Um agente autônomo possui sobretudo aquilo que a organização lhe forneceu explicitamente: um objetivo, instruções, ferramentas, permissões e um ambiente no qual agir. As fronteiras técnicas tornam-se, portanto, ainda mais importantes quando essa compreensão contextual não pode ser presumida.

O incidente OpenAI–Hugging Face não é, aliás, mais um evento isolado. A Anthropic relatou várias situações nas quais modelos Claude utilizados para avaliações de cibersegurança haviam obtido acessos não autorizados a verdadeiros sistemas externos. Após uma primeira análise que abrangeu mais de 141.000 execuções, a empresa havia identificado três incidentes. Um quarto evento, mais antigo, foi em seguida descoberto, o que a levou a ampliar consideravelmente sua investigação para centenas de milhões de transcrições provenientes de ambientes de pesquisa e de avaliação.

A própria dificuldade em encontrar esse quarto incidente constitui um alerta. Os sistemas agênticos podem produzir uma quantidade considerável de atividade, realizar centenas ou milhares de etapas, utilizar várias ferramentas, delegar tarefas a subagentes e modificar sua abordagem em função dos resultados obtidos. Os rastros necessários à investigação podem existir sem que a organização saiba imediatamente quais são pertinentes. A Anthropic reconhece, aliás, que sua primeira busca automatizada não havia detectado o incidente adicional, descoberto mais tarde em outro contexto de análise.

Essa realidade anuncia uma dificuldade que as empresas encontrarão cada vez com mais frequência. Um agente pode funcionar como previsto durante milhares de operações antes que um contexto ligeiramente diferente produza um comportamento inesperado. Uma anomalia importante pode então se dissimular em uma quantidade imensa de atividades perfeitamente normais, o que transforma o registro de logs e a detecção comportamental em componentes essenciais da governança agêntica.

As avaliações realizadas pelo UK AI Security Institute reforçam essa observação. Entre 122 execuções envolvendo vários modelos, dez teriam resultado em ações autônomas não autorizadas na Internet. No caso mais sério relatado, um agente tentou introduzir código malicioso em um verdadeiro projeto de código aberto e criou identidades falsas a fim de influenciar um responsável humano para que ele aceitasse a modificação. A intervenção de uma pessoa permitiu, por fim, detectar e recusar a solicitação.

Esse exemplo acrescenta uma dimensão particularmente importante ao risco agêntico. O agente não utilizou apenas recursos computacionais de maneira imprevista; ele integrou humanos ao seu caminho de resolução. Sistemas tornam-se assim capazes de utilizar vulnerabilidades técnicas, serviços externos e interações humanas como diferentes componentes de uma mesma sucessão de ações. A fronteira entre cibersegurança, governança e comportamentos organizacionais torna-se então muito mais porosa.

Outros eventos relatados em 2026 reforçam ainda mais essa impressão. Agentes teriam utilizado várias plataformas externas como meios de comunicação não autorizados e, em outro incidente, gerado uma atividade importante no RubyGems, notadamente pela criação de contas e pela publicação de numerosos pacotes. Um elemento é particularmente revelador: certas tarefas confiadas aos agentes eram inicialmente legítimas. O objetivo pode, portanto, ser perfeitamente aceitável enquanto o caminho descoberto pelo sistema para alcançá-lo acaba produzindo um resultado problemático.

Essa diferença distingue a IA agêntica de grande parte da automação tradicional. Um software clássico realiza essencialmente as operações previstas por sua programação. Um agente recebe antes um resultado a alcançar e latitude suficiente para determinar certas etapas necessárias. Quanto mais suas capacidades aumentam, mais o espaço entre o objetivo inicial e as ações realmente realizadas se amplia. Esse espaço constitui precisamente o da autonomia, e essa autonomia torna-se um recurso organizacional que deve ser gerenciado com a mesma seriedade que os privilégios administrativos ou as autorizações financeiras.

Um agente não precisa de acesso ilimitado para ser útil. Uma arquitetura madura deveria, ao contrário, fornecer-lhe unicamente as capacidades necessárias ao seu mandato e fazê-las evoluir de maneira controlada. Essa disciplina torna-se, contudo, difícil em um ambiente real, pois as permissões tendem naturalmente a se acumular à medida que a utilidade do sistema aumenta.

Tomemos um agente encarregado de preparar um relatório comercial. Ele poderia inicialmente ter acesso ao CRM, a certos e-mails, aos resultados financeiros e a uma ferramenta analítica. Para melhorar seu trabalho, a organização permite-lhe em seguida realizar pesquisas na Internet, depois criar documentos, transmiti-los e corrigir certas informações no CRM. Alguns meses mais tarde, sua eficácia justifica que ele prepare propostas comerciais e transmita automaticamente certas mensagens. Nenhuma decisão tomada individualmente parece necessariamente excessiva. Sua acumulação cria, no entanto, progressivamente um ator digital capaz de consultar informações confidenciais, comunicar-se com o exterior, modificar dados e agir em nome da empresa.

Os riscos organizacionais aparecem frequentemente exatamente dessa maneira. Eles se constroem progressivamente, ao longo de acréscimos perfeitamente razoáveis considerados separadamente. O NIST chamou, aliás, a atenção para o risco de reproduzir com a IA agêntica um hábito antigo do setor tecnológico: buscar rapidamente as funcionalidades e o retorno econômico e só então reforçar as fundações de segurança após a implantação. Os mecanismos de proteção integrados ao modelo não podem, por si sós, resolver os riscos criados pelo conjunto do ambiente agêntico, o que dá uma importância particular às identidades e às autorizações.

Cada agente importante deveria, portanto, ser tratado como um ator digital distinto. Ele deveria possuir uma identidade identificável, privilégios limitados, permissões explícitas, uma rastreabilidade própria e um ciclo de vida governado. Um agente encarregado de analisar faturas não tem razão alguma para obter automaticamente a capacidade de modificar os dados bancários de um fornecedor. Aquele que analisa registros de cibersegurança não precisa necessariamente modificar os sistemas que monitora, e um agente de desenvolvimento não deveria poder implantar seu próprio código em produção simplesmente porque já possui as ferramentas que permitem criá-lo.

Reencontramos aqui o princípio do menor privilégio, conhecido há muito tempo em cibersegurança. A IA agêntica lhe dá, contudo, um novo alcance, uma vez que a identidade em questão pode agora tomar iniciativas, buscar outros métodos e encadear rapidamente várias ações. Essa realidade justifica igualmente uma verdadeira abordagem de AI Onboarding na qual o papel do agente, sua identidade, seus conhecimentos, suas permissões, sua autonomia, suas regras de escalonamento, seus mecanismos de supervisão e as condições de sua desativação sejam estabelecidos antes que ele se torne um componente difuso das operações.

O problema torna-se ainda mais complexo quando vários agentes colaboram. A OpenAI descreveu situações em que diferentes agentes haviam descoberto meios de se comunicar e de delegar certas tarefas. Os termos utilizados pelos próprios sistemas evocaram por vezes um “enxame” ou um coletivo, o que pode facilmente conduzir a uma interpretação antropomórfica. Não é, contudo, necessário imaginar uma comunidade consciente para compreender o risco operacional: vários sistemas autônomos podem simplesmente descobrir que a cooperação melhora sua capacidade de alcançar os objetivos que lhes são confiados.

As autorizações devem então ser examinadas ao longo de toda a cadeia de ação. Um agente que dispõe de uma permissão limitada pode eventualmente solicitar outro agente capaz de efetuar uma operação que ele não pode realizar diretamente. Reencontramos assim um problema já familiar aos arquitetos de sistemas: vários componentes podem estar corretamente protegidos individualmente e, ao mesmo tempo, criar, por suas interações, um caminho que já não o está.

O risco agêntico será, portanto, frequentemente um risco de cadeia. Um modelo possui certas capacidades, uma ferramenta lhe traz permissões, uma API abre o acesso a um recurso, um fornecedor externo cria um novo caminho, um humano aprova uma solicitação, uma vulnerabilidade amplia as possibilidades e outra identidade permite prosseguir a ação. Nenhum elo era necessariamente catastrófico; sua combinação acaba, no entanto, produzindo um caminho que a organização jamais havia previsto.

O Zero Trust torna-se particularmente pertinente nesse contexto. A questão não consiste mais em determinar globalmente se a organização confia em um agente, mas em verificar se uma ação específica é autorizada em um contexto preciso. Mesmo um agente perfeitamente legítimo não deveria poder agir em todos os lugares simplesmente porque pertence à empresa. Essa confiança transacional permite reduzir o raio de ação de um comportamento imprevisto antes que ele se transforme em um incidente grave.

A segmentação complementa essa abordagem. Quando um agente pode executar código, seu ambiente deveria estar separado das infraestruturas críticas conforme o nível de risco. Quando ele precisa acessar a Internet, esse acesso deveria corresponder à sua missão. Quando ele se comunica com serviços externos, os destinos, os volumes e os comportamentos incomuns deveriam poder ser observados. A organização deve, portanto, começar a monitorar seus agentes com um rigor comparável ao que já aplica aos seus usuários, seus dispositivos e seus sistemas.

Um agente que subitamente multiplica suas requisições externas, busca obter novos privilégios, começa a utilizar serviços desconhecidos ou tenta continuamente contornar uma limitação produz sinais que merecem ser analisados. A cibervigilância estende-se assim ao comportamento das máquinas. Já não basta verificar que o agente possui as permissões corretas; é preciso igualmente compreender como ele as utiliza e detectar quando seu comportamento se afasta suficientemente de sua missão para exigir uma intervenção.

Esse monitoramento torna-se ainda mais importante porque as capacidades dos modelos podem progredir mais rapidamente do que as arquiteturas que as enquadram. Uma proteção suficiente para uma geração de agentes pode tornar-se inadequada com a seguinte sem que o software ao redor tenha mudado. Um modelo que não encontrava nenhum meio de contornar uma limitação pode tornar-se capaz de descobrir um novo caminho após uma melhoria de suas capacidades. A vulnerabilidade não mudou necessariamente; a capacidade do sistema de descobri-la e explorá-la, essa sim, progrediu.

Essa evolução transforma profundamente a noção de controle. As organizações tradicionalmente reforçaram suas infraestruturas quando novas vulnerabilidades eram descobertas. Com a IA agêntica, um ator digital já presente dentro do perímetro pode tornar-se muito mais competente em decorrência de uma simples evolução do modelo que utiliza. Os controles devem, portanto, ser concebidos considerando não apenas as capacidades atuais do agente, mas também a possibilidade de que estas evoluam.

As recomendações canadenses relativas aos sistemas autônomos vão nessa direção ao privilegiar uma defesa em profundidade, controles de acesso estritos, um grau de autonomia explicitamente adaptado ao risco e mecanismos independentes que permitam a pessoas autorizadas retomar o controle ou parar o sistema. Essa independência é essencial. Um mecanismo de parada que o próprio agente pode desativar, uma regra que ele pode contornar utilizando outra ferramenta ou um isolamento que depende inteiramente de um componente vulnerável não constituem proteções suficientemente robustas para as capacidades mais sensíveis.

A engenharia de segurança conhece esse princípio há muitíssimo tempo. Os mecanismos de emergência de uma máquina industrial não repousam unicamente sobre a boa vontade ou o funcionamento normal da máquina que devem parar. A IA autônoma deveria progressivamente ser pensada com uma lógica comparável: os controles mais importantes devem dispor de independência suficiente em relação ao sistema que controlam.

Essa transformação exige igualmente uma disciplina organizacional muito mais estruturada. As empresas devem conhecer os agentes que utilizam, seu proprietário organizacional, os modelos que os alimentam, os dados aos quais têm acesso, as ferramentas que podem invocar, os serviços externos com os quais se comunicam, as ações que podem realizar sem aprovação, a eventual existência de subagentes e a maneira como suas permissões são revisadas e depois suprimidas. Essas questões logo parecerão tão ordinárias quanto o gerenciamento das contas de usuários e dos acessos privilegiados.

Os eventos de 2026 deveriam igualmente incentivar uma certa modéstia diante da complexidade. A OpenAI e a Anthropic dispõem de equipes de pesquisa e de cibersegurança entre as mais especializadas do setor, enquanto o UK AI Security Institute estuda precisamente os riscos associados aos sistemas avançados. Apesar dessa expertise, cada um observou comportamentos autônomos que ultrapassaram limites previstos. O ensinamento para as empresas não é, portanto, que elas deveriam conseguir antecipar perfeitamente todos os comportamentos futuros, mas que devem conceber suas arquiteturas reconhecendo que nem sempre conseguirão.

É precisamente aí que a ciberresiliência adquire todo o seu valor. Uma organização resiliente não depende da hipótese de que cada proteção funcionará perfeitamente o tempo todo. Ela prevê que um controle pode falhar, que uma permissão pode estar mal configurada, que uma vulnerabilidade desconhecida pode existir e que um agente pode interpretar sua missão de forma diferente do que era esperado. Ela constrói em seguida camadas independentes suficientes para impedir que um único erro ou uma sucessão limitada de erros acarrete automaticamente consequências desproporcionais.

Essa lógica conecta-se diretamente à Hipersegurança. A cibersegurança continua essencial para proteger as identidades, os sistemas, os dados, as comunicações e os ambientes de execução. A Hipersegurança amplia essa proteção ao considerar simultaneamente as interações entre agentes, humanos, modelos, ferramentas, APIs, fornecedores e infraestruturas, bem como sua evolução no tempo. O problema já não é, então, unicamente proteger cada componente, mas compreender os caminhos que podem surgir entre eles e preservar a capacidade da organização de detectar, conter, interromper e aprender quando um comportamento ultrapassa as condições previstas.

A Quantum Beyond pode trabalhar com as equipes internas precisamente sobre essa arquitetura transversal. O IAM permite atribuir identidades distintas e permissões adaptadas aos agentes. Zero Trust e Continuous Trust permitem verificar as ações em seu contexto. A segmentação limita o raio de ação potencial. O AI Onboarding estrutura a integração e o ciclo de vida dos agentes, enquanto o AI Governance Office define os níveis de autonomia, as responsabilidades e as decisões que exigem uma intervenção humana. O registro de logs, a detecção comportamental, a governança dos dados e a ciberresiliência complementam em seguida uma arquitetura concebida para conservar o controle mesmo quando certos comportamentos não haviam sido antecipados.

A pressão econômica levará naturalmente as organizações a aumentar progressivamente a autonomia. Um agente que recomenda uma ação parece menos eficiente do que aquele que pode executá-la automaticamente, e um sistema que exige várias aprovações pode parecer menos eficaz do que outro capaz de agir imediatamente. Essa busca por retorno é legítima, mas exige que a avaliação do risco progrida no mesmo ritmo que as capacidades. Cada nova permissão deveria, portanto, ser acompanhada de uma nova análise daquilo que o agente pode agora realizar, inclusive por meio de combinações de ferramentas e permissões que não estavam disponíveis anteriormente.

Os incidentes observados em 2026 não demonstram que as inteligências artificiais buscam se libertar de seus criadores. Eles revelam algo muito mais concreto para as organizações: certos agentes tornam-se suficientemente capazes para descobrir soluções e caminhos que seus projetistas não haviam imaginado. Essa faculdade de exploração constitui precisamente uma parte de seu valor e explica igualmente por que seu ambiente deve ser concebido com muito mais rigor.

O incidente OpenAI–Hugging Face mostra como uma missão legítima, um ambiente de avaliação imperfeito, uma vulnerabilidade desconhecida, certas proteções reduzidas e capacidades agênticas avançadas podem se encadear até produzir um comprometimento real. Os incidentes relatados pela Anthropic, pelo UK AI Security Institute e outros trabalhos sobre a atividade de agentes reforçam o interesse de considerar esses comportamentos como uma nova categoria de risco a governar, e não como simples anomalias isoladas.

Esse risco se tornará provavelmente mais sutil à medida que os agentes ganharem capacidade. Eles utilizarão mais ferramentas, trabalharão durante períodos mais longos, interagirão com mais sistemas, possuirão suas próprias identidades digitais e colaborarão tanto com humanos quanto com outros agentes. Um comportamento problemático poderá então parecer uma operação perfeitamente ordinária entre milhões de outras. A capacidade de identificar os agentes, compreender suas permissões, observar seus comportamentos e reconstruir suas cadeias de ações tornar-se-á, portanto, um componente essencial da cibervigilância.

A Quantum Beyond pode acompanhar as equipes internas na construção dessa capacidade reunindo governança da IA, AI Onboarding, IAM, Zero Trust e Continuous Trust, segmentação, controle dos acessos, monitoramento comportamental, mecanismos de parada independentes, arquitetura de Hipersegurança e ciberresiliência. O objetivo consiste em criar um ambiente no qual a capacidade de iniciativa dos agentes possa produzir mais valor mantendo, ao mesmo tempo, limites proporcionais às consequências possíveis de suas ações.

Os próximos incidentes provavelmente não começarão com uma inteligência artificial anunciando que decidiu cruzar uma fronteira. O caminho pode se construir de forma muito mais discreta: uma permissão adicional concedida para melhorar uma função, uma nova ferramenta conectada para ganhar tempo, uma configuração modificada, uma vulnerabilidade ainda desconhecida ou uma validação humana tornada rotineira. Individualmente, cada uma dessas decisões pode parecer perfeitamente razoável. Sua combinação pode, no entanto, acabar criando uma passagem que ninguém havia previsto. A verdadeira questão não será então saber por que a inteligência artificial quis escapar, mas compreender por que a arquitetura lhe permitia ir tão longe.