CEVIU Logo
Voltar
Avaliação de 13 modelos de IA na detecção de CVEs conhecidas revela GPT-5.6 e Kimi K3 no topo

Avaliação de Modelos de IA na Detecção de Vulnerabilidades Revela Líderes e Estratégias Otimizadas

Aprofundamento CEVIU

Aprofundamento

Um estudo recente da Aikido revelou que os modelos de IA, em especial o GPT-5.6 e o Kimi K3, estão atingindo patamares elevados na detecção de vulnerabilidades, com recall de 88,5% em 26 CVEs conhecidas. A pesquisa usou um sistema de análise de código (harness) em produção, simulando o trabalho de um auditor humano. Este tipo de abordagem com "harnesses" já vinha sendo discutido em nossa cobertura anterior, como no artigo "Harnesses e post-training: como fechar a lacuna na descoberta de vulnerabilidades com modelos open-weight", de 6 de junho de 2026, que destacava a importância dessas ferramentas para orientar a IA ao código correto.

O grande ponto do estudo não é apenas a capacidade bruta dos modelos, mas como otimizá-los. Ele sugere que múltiplas execuções de modelos de IA mais acessíveis podem superar a eficácia de uma única passada de um modelo top de linha. Isso reforça o que já notávamos em 18 de junho de 2026, na matéria "Consórcio de quatro LLMs alcança 86,2% de concordância unânime na detecção de vulnerabilidades", onde um grupo de modelos atuando em conjunto mostrou maior acurácia. A dificuldade maior para a IA ainda reside no raciocínio complexo, como rastrear injeções SQL indiretas, onde apenas os modelos mais avançados se saem bem. Vulnerabilidades mais óbvias, como RCEs e XSS, já são amplamente detectadas por quase todos os modelos.

O que mudou

A grande novidade deste estudo é a ascensão do Kimi K3. Lançado após a publicação inicial da pesquisa, o modelo foi rapidamente benchmarkado e empatou com o GPT-5.6 na pontuação máxima de recall, mostrando ser uma alternativa poderosa e mais econômica. Anteriormente, nossa análise de 19 de junho de 2026, "Cérebro do tamanho de um planeta: IA pensa mais, mas não necessariamente melhor em segurança", já comparava a performance de modelos como GPT-5.4/5.5 e Claude 4.6/4.7, mas o Kimi K3 representa um novo patamar, especialmente entre os modelos mais custo-efetivos, como o GLM 5.2, que já havia se destacado em 1 de julho de 2026 por seu custo-benefício contra o Claude na detecção de IDORs.

A pesquisa atual também valida a evolução dos modelos open-weight. O GLM-5.2, por exemplo, já consegue redescobrir 59% das vulnerabilidades, mostrando um avanço significativo que o coloca no meio do pelotão dos modelos proprietários. Isso confirma a tendência de que a IA de código aberto está "pegando" rápido, algo que acompanhamos de perto com matérias sobre o GLM 5.1 e suas capacidades em "harnesses" especializados, como notado na cobertura de 1 de julho de 2026 sobre testes de IA local para pentest.

Por que isso importa

Para equipes de cibersegurança e desenvolvedores, este estudo é um guia prático. Ele mostra que não é preciso investir no modelo mais caro para ter uma segurança robusta. A estratégia de múltiplas execuções de modelos mais baratos pode ser mais eficaz e econômica. Isso otimiza o orçamento de segurança e democratiza o acesso a ferramentas avançadas de detecção de vulnerabilidades.

Além disso, o foco no "harness" como elemento crucial destaca que a IA não é uma bala de prata isolada. O sistema de análise, que direciona o modelo ao código certo e interpreta os resultados, é tão importante quanto o modelo em si. Isso indica que investir na infraestrutura de análise de segurança baseada em IA é tão vital quanto escolher o modelo de IA.

Linha do tempo

  1. Matéria sobre a importância de harnesses e post-training para modelos open-weight na detecção de vulnerabilidades.

  2. Cobertura comparando plataformas de teste de segurança de IA: Aikido vs. XBOW.

  3. Análise revela que consórcio de quatro LLMs alcança 86,2% de concordância em detecção de vulnerabilidades.

  4. Artigo "Cérebro do tamanho de um planeta" testa Claude 4.6/4.7 e GPT-5.4/5.5 na detecção de vulnerabilidades.

  5. Matéria "GLM 5.2 supera Claude em detecção de IDOR" discute custo-benefício e design de harness.

  6. Estudo sobre o uso de IA local para testes de invasão e pesquisa de segurança.

  7. Estudo da Aikido avalia 13 modelos de IA na detecção de 26 vulnerabilidades, destacando GPT-5.6 e Kimi K3.

Perguntas frequentes

O que é o "harness" mencionado no estudo da Aikido?

O "harness" é um sistema de análise de código que transforma um modelo de linguagem em um auditor de segurança. Ele direciona a IA para escanear o código-fonte, investigar fluxos suspeitos e triar as descobertas para identificar vulnerabilidades reais, simulando a forma como um auditor humano trabalha.

Quais modelos de IA se destacaram na detecção de vulnerabilidades?

Os modelos GPT-5.6 e Kimi K3 foram os que mais se destacaram, alcançando 88,5% de recall (23 de 26 CVEs conhecidas). Outros modelos como o Grok-4.5 também tiveram bom desempenho, enquanto as variantes do Claude Opus ficaram um pouco abaixo.

Por que a estratégia de múltiplas execuções de modelos de IA é relevante para a segurança?

A estratégia de múltiplas execuções (pooling) de modelos mais acessíveis pode ser mais eficaz e econômica do que uma única passada de um modelo top de linha. Cada execução pode encontrar um subconjunto diferente de vulnerabilidades, e a combinação dos resultados aumenta o recall total por um custo menor.

Qual o maior desafio da IA na detecção de vulnerabilidades complexas?

O maior desafio da IA está no raciocínio complexo, como o rastreamento de injeções SQL indiretas. Nesses casos, a IA precisa seguir longas cadeias lógicas e identificar falhas que não têm um "sink" óbvio, algo que apenas os modelos mais avançados conseguem fazer com eficácia.

Fontes

Avalie este artigo:
Compartilhar:
Categoria
CEVIU Segurança da Informação
Publicado
22 de julho de 2026
Editoria
CEVIU Segurança da Informação

Quer receber mais sobre CEVIU Segurança da Informação?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser