Voltar

O Novo Benchmark que Desafia Modelos de IA em Bases de Código Empresariais Reais

Aprofundamento CEVIU

Aprofundamento

O Real-SWE é um novo benchmark que simula o trabalho de engenheiros de software em empresas reais. Ele avalia modelos de IA em bases de código proprietárias, não públicas, e em tarefas com consequências de negócio diretas, como faturamento e migração de clientes. Isso significa que os agentes de IA precisam navegar por sistemas proprietários, entender regras de negócio e seguir convenções de código específicas da empresa, algo que os diferencia de tarefas de benchmark sintéticas ou de código aberto.

Os resultados iniciais mostram que os modelos atuais atingem uma taxa máxima de resolução de apenas 38,8%. Essa baixa performance evidencia a complexidade e as lacunas no desenvolvimento da IA para este tipo de cenário. O benchmark foca em tarefas economicamente viáveis, extraídas de código real de empresas com grande volume de usuários, como plataformas de fintech e sistemas de vendas de IA, e que são inerentemente

Fontes

Avalie este artigo:
Categoria
CEVIU IA
Publicado
15 de setembro de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser