Modelos de Fronteira em IA Exibem Desempenho Irregular em Tarefas Agênticas Avançadas
Aprofundamento CEVIU
Aprofundamento
A pesquisa recente da Fig joga luz sobre um ponto crítico na evolução da Inteligência Artificial: o desempenho dos modelos de fronteira em tarefas agênticas complexas. Nomes como Astra e Opus 5.5, que representam o ápice em IA generativa, não entregam um desempenho consistente. Em vez de um campeão universal, o que se observa é uma “performance irregular”, ou como a Fig cunhou, um perfil “jagged”. Isso significa que um modelo pode ser excepcional em uma tarefa de automação web, mas falhar em outra similar, ou regredir em certas categorias mesmo após uma atualização. Não há um líder claro, pois o modelo que falha em uma tarefa consegue resolver outras que o supostamente superior não consegue.
Essa inconsistência vai além das tarefas digitais, como automação de navegadores, estendendo-se a domínios físicos, como manipulação robótica e condução autônoma. O estudo usa benchmarks como VisualWebArena, Bench2Drive, VLABench e IndEgo para demonstrar que a adequação entre modelo e tarefa varia enormemente. Para os desenvolvedores, isso sublinha a complexidade de escolher a ferramenta certa para cada aplicação, um desafio que já abordamos em nossa cobertura anterior, como na matéria de 31 de julho de 2026, “Desafios na Interação da IA com Interfaces Computacionais”, que discutia as dificuldades de IA em interagir com UIs, algo agora mais complexo pela imprevisibilidade dos modelos.
O que mudou
Nossa cobertura sobre IA tem apontado, em diversas ocasiões, os desafios de avaliação e a variabilidade de performance. Em 20 de agosto de 2026, com “Desafios da Automação com IA: GPT-5.6 Sol e as Discrepâncias de Performance em Benchmarks”, e em 15 de setembro de 2026, com “Alinhamento em Sistemas de IA: A Complexidade da Avaliação e a Percepção Humana”, já indicávamos que a avaliação de IAs e a confiabilidade dos agentes eram pontos críticos. O que a nova pesquisa da Fig adiciona é a confirmação e quantificação dessa “irregularidade” em modelos de fronteira, como Astra e Opus 5.5, mostrando que essa não é uma exceção para um ou outro modelo, mas uma característica sistêmica da vanguarda da IA agêntica. Anteriormente, eram indícios e casos pontuais; agora, temos uma análise que aponta para uma ausência generalizada de liderança consistente entre os principais modelos.
Além disso, a pesquisa explicita como as atualizações de modelos podem mudar o perfil de desempenho sem alterar significativamente a média geral. Isso valida o “Paradoxo da IA: Modelos Avançados, Ferramentas Menos Confiáveis”, discutido em 11 de julho de 2026, mostrando que um avanço em capacidade não se traduz automaticamente em maior confiabilidade ou em um desempenho uniformemente superior. A novidade é a profundidade da análise, que revela a troca de capacidades (ganhar algumas tarefas, perder outras) mesmo em pequenas variações de performance média.
Por que isso importa
Para quem trabalha com IA, essa pesquisa é um divisor de águas. Não se pode mais confiar apenas em pontuações médias de benchmarks para selecionar um modelo. A escolha de um agente de IA deve ser criteriosa, considerando o fit específico entre o modelo e as nuances de cada tarefa. Uma IA pode ser excelente para navegar em um tipo de site e péssima em outro, ou operar bem em uma tarefa de montagem e falhar em uma similar. Isso exige dos integradores e engenheiros de prompt uma compreensão muito mais profunda das capacidades e limitações de cada modelo, forçando-os a testar extensivamente em cenários reais.
A Fig, ao lançar o dataset RIDGE, oferece uma ferramenta valiosa para essa análise item a item, permitindo uma visão detalhada dos resultados e das saídas dos modelos em diversas tarefas. Isso é fundamental para a construção de agentes de IA mais robustos e confiáveis, movendo a indústria para além de métricas superficiais e em direção a uma avaliação mais granular e prática. O impacto direto é na estratégia de desenvolvimento e implantação de IAs, exigindo mais customização e menos “tamanho único”.
Linha do tempo
Matéria 'Produtividade com IA: as Evidências São Mistas, Mas o Padrão É Claro' discute o desempenho da IA em tarefas complexas.
Matéria 'Paradoxo da IA: Modelos Avançados, Ferramentas Menos Confiáveis' destaca a inconsistência entre avanço e confiabilidade.
Matéria 'Desafios na Interação da IA com Interfaces Computacionais' aborda as dificuldades da IA em interagir com UIs.
Matéria 'Desvendando a Melhor Linguagem para Agentes de IA: Um Desafio Complexo' explora as falhas idiossincráticas das linguagens para agentes.
Matéria 'Desafios da Automação com IA: GPT-5.6 Sol e as Discrepâncias de Performance em Benchmarks' aponta inconsistências em benchmarks.
Matéria 'Alinhamento em Sistemas de IA: A Complexidade da Avaliação e a Percepção Humana' debate os desafios na avaliação de falhas em sistemas de IA.
Pesquisa Fig revela que modelos de fronteira em IA, como Astra e Opus 5.5, exibem 'desempenho irregular' em tarefas agênticas, sem um líder claro.
Perguntas frequentes
O que significa 'desempenho irregular' (jagged performance) nos modelos de IA?
Significa que os modelos de IA de fronteira não apresentam um desempenho uniforme em todas as tarefas. Um modelo pode ser muito bom em algumas atividades e falhar inesperadamente em outras, mesmo que sejam similares. Não há um campeão que seja o melhor em tudo.
Por que não há um 'líder claro' entre os principais modelos de IA agêntica?
A pesquisa mostra que, para cada par de modelos avaliados, o modelo com menor pontuação geral ainda consegue resolver tarefas que o suposto líder falha. Isso sugere que as capacidades são mais complementares e específicas a cada cenário, em vez de hierárquicas.
Como essa pesquisa afeta a escolha e o uso prático de IAs agênticas?
Os desenvolvedores e empresas precisam abandonar a ideia de escolher o 'melhor' modelo com base apenas em médias de benchmarks. É crucial fazer testes rigorosos e considerar a adequação específica de cada modelo para a tarefa em questão, pois a performance varia muito dependendo do domínio e da atividade.
O que é o RIDGE, mencionado na pesquisa?
RIDGE é um dataset liberado pela Fig que contém resultados detalhados item a item e as saídas dos modelos em todos os cinco domínios de avaliação. Ele serve como uma ferramenta para que outros pesquisadores possam aprofundar a análise da performance dos modelos de IA, examinando a granularidade dos resultados.
Fontes
- fig.incfonte original
- Categoria
- CEVIU IA
- Publicado
- 30 de setembro de 2026
- Editoria
- CEVIU IA

