I. A Fatura que Cresce Enquanto o Agente “Pensa”
Um agente autônomo que resolve uma tarefa complexa frequentemente o faz em múltiplos ciclos de raciocínio: avalia uma abordagem, chama uma ferramenta, reavalia o resultado, tenta de novo. Cada ciclo consome inferência — e cada inferência tem custo direto, cobrado por token ou por chamada. Esse modelo de precificação, desenhado para refletir uso real, cria uma superfície de ataque que a segurança tradicional não foi construída para ver: manipular o raciocínio do agente para que ele entre em um ciclo que não termina, ou que se repete além do necessário, é, ao mesmo tempo, um ataque técnico e um ataque financeiro.
Sugerimos nomear esse mecanismo Orçamento Indefinido: a ausência de um teto de gasto vinculado ao comportamento de raciocínio do agente, que permite que um erro de lógica, uma instrução maliciosa ou um simples bug transforme uma tarefa de custo esperado em uma fatura que só para quando alguém humano percebe e intervém. A OWASP classifica formalmente esse risco como LLM10 (Consumo Ilimitado) na sua lista de 2025, com o exemplo explícito de exploração do modelo de custo por uso como um dos dois cenários mais comuns da categoria.
O pesquisador Johann Rehberger documentou esse padrão antes mesmo da era dos agentes de ferramenta plena: em setembro de 2023, alertou publicamente sobre agentes que entravam em loops infinitos de raciocínio; em julho de 2024, publicou um segundo alerta sobre indisponibilidade induzida por consumo excessivo. Uma revisão acadêmica dedicada especificamente ao tema, publicada em 2025, generaliza o mecanismo para ambientes serverless, descrevendo-o como a exploração deliberada da estrutura de cobrança por uso (pay-as-you-go) para onerar financeiramente o proprietário da aplicação.
[Ponto de Inflexão Fiduciária]: Existe hoje um teto de gasto configurado, por agente e por tarefa, que interrompe automaticamente a execução antes que um loop de raciocínio malicioso ou defeituoso gere uma fatura fora do orçamento aprovado?
II. Quando a Infraestrutura Legítima Vira a Arma
O mesmo princípio de exploração de recurso legítimo apareceu, em 2026, em uma forma tecnicamente distinta, mas estruturalmente próxima: o CVE-2026-49975, uma vulnerabilidade de negação de serviço no módulo mod_http2 do servidor Apache, afetando versões de 2.4.17 a 2.4.67, com pontuação CVSS de 7,5. O mecanismo explora amplificação HPACK — a técnica de compressão de cabeçalho do protocolo HTTP/2 — combinada a controle de fluxo, permitindo consumir até 32 gigabytes de memória do servidor em uma janela de dez a quarenta e cinco segundos, com fatores de amplificação medidos em 5.700 para 1 em servidores Envoy e 4.000 para 1 em servidores Apache.
O detalhe mais relevante para esta série não é a vulnerabilidade em si, mas como ela foi descoberta: por um agente de IA (Codex) guiado por um pesquisador humano, Quang Luong, e documentada publicamente pela BleepingComputer. A mesma capacidade de raciocínio autônomo que gera exposição a Orçamento Indefinido também é, na outra ponta, capaz de encontrar a vulnerabilidade que explora exatamente esse tipo de mecanismo em infraestrutura alheia — um agente descobrindo como outro agente, ou um atacante, poderia esgotar recurso computacional através de uma amplificação de protocolo legítimo.

Esse padrão de infraestrutura legítima transformada em arma de esgotamento de recurso não é inédito — o precedente mais conhecido é o HTTP/2 Rapid Reset, documentado pela Cloudflare em outubro de 2023: uma botnet de aproximadamente vinte mil máquinas gerou 201 milhões de requisições por segundo, o maior ataque de negação de serviço registrado publicamente até aquele momento, mitigado antes da divulgação pública. A diferença estrutural entre 2023 e 2026 é o ator: em 2023, o mecanismo era operado por uma botnet humana coordenada; em 2026, a mesma classe de vulnerabilidade foi descoberta por um agente autônomo, mostrando que a velocidade de descoberta desse tipo de falha também migrou para a era agêntica.
[Ponto de Inflexão Fiduciária]: A nossa infraestrutura de agentes já foi avaliada quanto a vulnerabilidades de amplificação de protocolo — HTTP/2 ou equivalente — que poderiam ser exploradas para gerar consumo de recurso muito acima do esperado por uma única requisição legítima?
III. O Loop que Ninguém Programou para Parar
Esse cenário, embora hipotético, não depende de nenhuma intenção maliciosa — ilustra como a ausência de um critério de parada explícito, combinada a um modelo de custo por uso, transforma um caso de suporte comum em exposição financeira. A boa prática sugere que Comitês de Risco tratem esse tipo de falha como categoria distinta de um ataque deliberado, mas igualmente relevante: ambos exploram a mesma ausência estrutural de controle de orçamento por execução.
Vale considerar que um atacante deliberado tem uma vantagem adicional sobre o cenário acidental acima: pode desenhar a entrada especificamente para maximizar o número de ciclos de raciocínio antes de qualquer critério de parada, tornando o ataque financeiro mais eficiente do que o acaso jamais seria.
[Ponto de Inflexão Fiduciária]: Os agentes autônomos da nossa organização têm um número máximo de ciclos de raciocínio configurado por tarefa, ou dependem exclusivamente de o próprio agente decidir quando parar de tentar?
IV. A Resposta Nomeada: Teto de Gasto como Controle de Segurança
A resposta a esse mecanismo não é primariamente técnica de segurança cibernética tradicional — é uma fusão entre controle financeiro (FinOps) e controle de segurança, tratando o teto de gasto por agente e por tarefa como uma camada de defesa, não apenas como um parâmetro de otimização de custo. A boa prática recomenda configurar limites explícitos de ciclos de raciocínio, de chamadas de ferramenta e de gasto monetário por execução, com interrupção automática ao atingir qualquer um desses limites.

Complementarmente, a proteção contra amplificação de infraestrutura — como a explorada pelo CVE-2026-49975 — exige que a organização mantenha os componentes de rede que sustentam seus agentes atualizados e monitorados quanto a padrões de consumo de recurso anômalo, tratando picos de uso de memória ou CPU como sinalizador de segurança, não apenas de capacidade.
Há também uma dimensão contratual pouco discutida: acordos de nível de serviço com provedores de inferência raramente preveem um teto de gasto imposto pelo cliente, apenas alertas de faturamento após o consumo já ter ocorrido. Sugerimos que a área de compras trate a existência de controle de interrupção automática, e não apenas de alerta a posteriori, como critério de seleção de fornecedor — a diferença entre os dois modelos é exatamente a diferença entre prevenir e apenas documentar o excesso já consumido.
☐ A configuração de um teto explícito de ciclos de raciocínio, chamadas de ferramenta e gasto monetário por execução de agente, com interrupção automática ao atingir qualquer limite, pode reduzir de forma mensurável a exposição a Orçamento Indefinido.
☐ Um alerta automático para picos de custo de inferência associados a uma única tarefa ou ticket tende a permitir intervenção humana antes que o padrão observado no cenário desta seção se repita em escala real.
☐ Vale considerar auditoria periódica dos componentes de infraestrutura de rede que sustentam os agentes, quanto a vulnerabilidades de amplificação de protocolo já documentadas publicamente.
V. O Teste do Ácido
Se um agente da nossa organização entrasse amanhã em um loop de raciocínio que consumisse dez vezes o orçamento normal de uma tarefa, um limite automático interromperia a execução antes do fim do dia — ou só descobriríamos o problema ao revisar a fatura do mês seguinte?
🏛️ Biblioteca: Metodologia Prática
Protocolo de Controle de Orçamento por Execução Agêntica (PCOEA)
Este protocolo estabelece o roteiro mínimo para instituir controle de gasto como camada de segurança em agentes autônomos.
01. Checklist de Configuração de Limites
Orientamos que a equipe de engenharia confirme, para cada agente em produção, a existência dos seguintes limites explícitos:
- Limite de Ciclos de Raciocínio: Existe um número máximo de tentativas ou reavaliações antes de o agente escalar para um humano?
- Limite de Gasto por Execução: Existe um teto monetário configurado por tarefa, com interrupção automática ao ser atingido?
- Alerta de Anomalia de Consumo: Existe monitoramento que sinaliza, em tempo real, um pico de custo de inferência muito acima da média histórica?
02. Matriz de Risco por Mecanismo
| Mecanismo | Sinalizador de Risco | Ação Recomendada |
|---|---|---|
| Ausência de limite de ciclo de raciocínio | Agente pode tentar indefinidamente sem escalar para humano | Configurar número máximo de tentativas por tarefa |
| Ausência de teto de gasto por execução | Custo de inferência sem limite superior configurado | Implementar teto monetário com interrupção automática |
| Infraestrutura de rede não auditada | Componentes vulneráveis a amplificação de protocolo (ex.: HTTP/2) | Auditoria e atualização periódica de componentes de rede |
🛡️ Framework de Integridade Analítica (Metodologia)
Padrões e Dados Verificados: Toda alegação quantitativa deste artigo deriva de fonte nominal e verificável — OWASP LLM Top 10 2025 (LLM10), revisão acadêmica de Denial of Wallet em ambientes serverless (arXiv 2508.19284), Rehberger (embracethered.com, set. 2023 e jul. 2024), CVE-2026-49975 (NVD) e cobertura da BleepingComputer, e o precedente HTTP/2 Rapid Reset documentado pela Cloudflare (out. 2023).
⚖️ Isenção e Termos de Responsabilidade Fiduciária (Disclaimer)
Este material utiliza abordagem técnica e analítica inteiramente concebida para fortalecer a macroestratégia fiduciária no cerne de Conselhos de Administração. O conteúdo estrutural não constitui, sob nenhuma premissa, emissão de parecer de arquitetura de software, auditoria cibernética ou consultoria jurídica especializada para infraestrutura de TI. A FIDUCIA ADVISORY e o seu idealizador tático principal, Walter Maier Neto, declinam absolutamente de responder patrimonialmente ou civilmente por incidentes de segurança, recusas securitárias ou perdas financeiras originadas na adoção operacional destas diretrizes arquiteturais. A obrigação material e a homologação da governança tecnológica restam consolidadas na função de diligência exclusiva da liderança empossada legalmente.
📚 Referências Bibliográficas
-
OWASP. “OWASP Top 10 for LLM Applications 2025” — LLM10 (Unbounded Consumption).
-
Revisão acadêmica de Denial of Wallet em ambientes serverless. arXiv:2508.19284.
-
Rehberger, J. “Don’t Get Stuck in an Infinite Loop!” embracethered.com, 16 set. 2023; “Sorry, ChatGPT Is Under Maintenance.” embracethered.com, 8 jul. 2024.
-
CVE-2026-49975. National Vulnerability Database (NVD); cobertura técnica BleepingComputer.
-
Cloudflare. “HTTP/2 Rapid Reset: deconstructing the record-breaking attack.” blog.cloudflare.com, 10 out. 2023.
