O Novo Benchmark que Desafia Modelos de IA em Bases de Código Empresariais Reais
Aprofundamento CEVIU
Aprofundamento
O Real-SWE é um novo benchmark que simula o trabalho de engenheiros de software em empresas reais. Ele avalia modelos de IA em bases de código proprietárias, não públicas, e em tarefas com consequências de negócio diretas, como faturamento e migração de clientes. Isso significa que os agentes de IA precisam navegar por sistemas proprietários, entender regras de negócio e seguir convenções de código específicas da empresa, algo que os diferencia de tarefas de benchmark sintéticas ou de código aberto.
Os resultados iniciais mostram que os modelos atuais atingem uma taxa máxima de resolução de apenas 38,8%. Essa baixa performance evidencia a complexidade e as lacunas no desenvolvimento da IA para este tipo de cenário. O benchmark foca em tarefas economicamente viáveis, extraídas de código real de empresas com grande volume de usuários, como plataformas de fintech e sistemas de vendas de IA, e que são inerentemente
Fontes
- withspecific.comfonte original
- Categoria
- CEVIU IA
- Publicado
- 15 de setembro de 2026
- Editoria
- CEVIU IA
