Agentes de inteligência artificial podem passar horas planejando, chamando ferramentas e tentando concluir uma tarefa sem que o usuário acompanhe cada passo. Esse comportamento abre espaço para uma nova camada de segurança: observar o que acontece dentro do modelo, e não apenas ler a resposta que aparece na tela. A startup Goodfire apresentou um sistema que segue essa linha e promete identificar sinais de uso indevido antes que o agente complete uma ação perigosa.
A novidade foi noticiada pela TechCrunch em 8 de outubro de 2026. Os monitores foram disponibilizados para clientes da Baseten, plataforma que hospeda e executa modelos de IA. O produto usa pequenos detectores, chamados probes, para ler sinais internos a cada etapa do trabalho. Quando um detector aponta risco, outro modelo pode fazer uma análise mais detalhada.
O que significa monitorar por dentro
Um modelo de linguagem calcula sequências de tokens, que são pequenos blocos de texto usados para representar palavras e símbolos. Durante esse cálculo, surgem sinais internos relacionados ao caminho que o modelo está seguindo. A proposta da Goodfire é observar parte dessas ativações, em vez de esperar que o agente produza uma mensagem final e então pedir a outro modelo que leia todo o histórico.
A diferença parece abstrata, mas tem consequência operacional. Um agente que tenta explorar um servidor pode ainda não ter enviado o comando quando o sistema percebe que a sequência está tomando esse rumo. Um mecanismo de detecção antecipada pode registrar a atividade, solicitar revisão humana ou recusar a próxima etapa. Isso não elimina a necessidade de controles tradicionais, mas pode reduzir o tempo entre o indício e a reação.
Por que o custo do monitoramento importa
A forma mais comum de supervisionar um agente é usar outro modelo para reler as ações do primeiro. Esse segundo modelo precisa processar o histórico, identificar sinais de abuso e repetir a análise durante tarefas longas. Quando o agente trabalha por horas ou lida com muitos documentos, a supervisão pode consumir quase tantos recursos quanto a tarefa original.
A TechCrunch relata que, nos testes divulgados pela Goodfire com o modelo aberto Kimi K3, o monitoramento de 1 milhão de interações teria custado cerca de 185 dólares. A empresa comparou esse resultado com aproximadamente 5.420 dólares para um modelo de verificação mais barato e 200 mil dólares para um modelo de primeira linha. Esses números são declarações da própria Goodfire, não uma validação independente, e devem ser entendidos como referência de engenharia.
A startup também afirma que seus probes identificaram 93% das sessões de hacking malicioso e enviaram 5,5% das sessões inofensivas para uma segunda análise. O resultado mostra o compromisso inevitável entre bloquear ameaças e não interromper trabalhos legítimos. Um detector que recusa quase tudo não serve para uma equipe de desenvolvimento; um detector permissivo demais cria apenas uma sensação de segurança.
O problema dos modelos abertos
Modelos abertos podem ser baixados, executados em infraestrutura própria e modificados para diferentes usos. Essa liberdade é importante para pesquisa, soberania tecnológica e redução de dependência de um único fornecedor. Também significa que as barreiras aplicadas por uma empresa podem ser removidas por quem controla o ambiente de execução.
Por isso, a segurança não pode depender apenas de uma mensagem dizendo ao modelo para ser cuidadoso. Probes, políticas de rede, permissões mínimas, limites de tempo e aprovação humana formam camadas diferentes. Se uma camada falha, outra ainda pode interromper a ação. O conceito é conhecido como defesa em profundidade e já faz parte de práticas maduras de segurança de software.
O que equipes brasileiras podem aproveitar
Uma empresa brasileira não precisa contratar a Goodfire para aplicar o princípio. Ela pode começar definindo quais comportamentos devem gerar alerta. Tentativas de acessar domínios fora da lista, criação de usuários, alteração de permissões, leitura de segredos e envio de dados pessoais são exemplos de eventos que merecem registro e aprovação.
Em seguida, é preciso atribuir uma identidade própria ao agente. O agente deve ter uma conta separada da conta do desenvolvedor e permissões que possam ser revogadas. Cada chamada de ferramenta precisa registrar o modelo, o objetivo, os parâmetros, o resultado e a pessoa que autorizou o fluxo. Esse histórico permite investigar uma falha sem depender do texto final produzido pelo assistente.
Também vale testar o sistema com cenários controlados. A equipe pode criar um ambiente sem dados reais e instruir o agente a executar tarefas permitidas, tentar uma ação proibida e lidar com uma resposta ambígua. O teste deve medir quantos ataques simulados foram bloqueados, quantas atividades normais geraram falso positivo e quanto tempo a defesa acrescentou à operação.
Detecção não substitui isolamento
O monitoramento interno é uma camada promissora, mas não deve receber poderes que tornem uma falha catastrófica. Um agente que pode cancelar a própria supervisão, trocar suas permissões ou escrever em produção não está protegido porque existe um detector no caminho. A regra mais importante continua sendo conceder apenas o acesso necessário para a tarefa.
Ambientes de desenvolvimento, homologação e produção precisam permanecer separados. Chaves de API devem expirar e ser substituídas sem intervenção manual. Dados de clientes devem ser mascarados quando não forem necessários para o teste. Em fluxos críticos, a confirmação humana deve acontecer antes de uma ação externa, mesmo que o modelo pareça confiante sobre o resultado.
O próximo passo para a segurança de agentes
A tecnologia apresentada pela Goodfire aponta para uma mudança de foco. A defesa de agentes não deve olhar apenas para o texto que eles escrevem, mas também para o caminho que percorrem, as ferramentas que chamam e as permissões que tentam usar. Isso aproxima a segurança de IA da observabilidade de sistemas distribuídos, em que logs, métricas e rastros ajudam a entender um serviço enquanto ele funciona.
Para o Brasil, o tema é relevante porque modelos abertos e serviços de inferência podem ser usados por empresas locais sem que todas tenham uma grande equipe de segurança. A solução não será uma ferramenta isolada. Será uma combinação de identidade, isolamento, monitoramento, testes e revisão humana. Quanto mais um agente puder agir sozinho, mais importante será construir mecanismos para interrompê-lo antes do dano.



