Mercor e SkyRL Elevam Agentes de IA 'Frontier' com Treinamento Inovador
Aprofundamento CEVIU
Aprofundamento
A Mercor e a SkyRL deram um passo e tanto no treinamento de modelos de IA, elevando a capacidade dos chamados "agentes frontier". Usaram o Qwen3.5-397B-A17B para um pós-treinamento focado em tarefas complexas de "knowledge-work", como consultoria de gestão, banca de investimento e direito empresarial. O segredo não foi só o algoritmo, mas uma infraestrutura de treinamento robusta, que incluiu ambientes controlados, controle preciso de tokens e Reinforcement Learning assíncrono.
O resultado foi um aumento de 70% no desempenho APEX-Agents Pass@1, um benchmark de 1.928 tarefas de trabalho do conhecimento. Este é um salto enorme para a autonomia dos agentes, mostrando que otimizar o ambiente de treinamento, o design do harness (a interface do agente com o ambiente) e a contagem de tokens exata são tão cruciais quanto o próprio modelo. A experimentação mostrou que refinar esses elementos pode render ganhos equivalentes a um ciclo inteiro de treinamento.
O que mudou
A Mercor e a SkyRL vêm aprimorando seu método de pós-treinamento há algum tempo. Em janeiro, eles já tinham mostrado que poucas tarefas rotuladas por especialistas podiam quase dobrar a pontuação de um modelo open-weight no APEX-Agents. Em fevereiro, escalaram o dataset para quase 2.000 casos, com o modelo Applied Compute: Small, treinado a partir do GLM-4.7 355B, alcançando a liderança em direito corporativo.
A diferença agora é a abertura da receita: eles reproduzem esses ganhos com o SkyRL público, estendendo-os ao modelo de 397 bilhões de parâmetros, o Qwen3.5-397B-A17B, e liberam o script de treinamento completo, os pesos do modelo e os rastros de avaliação. Além disso, a família Qwen continua em evolução; o CEVIU noticiou, em 13 de agosto de 2026, o lançamento do Qwen3.8, que é baseado na arquitetura do Qwen3.5 e promete melhorias significativas na execução de agentes. Este trabalho atual com o Qwen3.5-397B-A17B demonstra um avanço prático e validado, enquanto a versão 3.8 já aponta para o próximo nível de capacidades.
Por que isso importa
A capacidade de agentes de IA lidarem com tarefas complexas de "knowledge-work" representa um avanço tremendo. Pense em automação de processos em consultoria, direito ou finanças. A metodologia da Mercor e SkyRL mostra que não basta ter um modelo grande; é preciso um processo de treinamento meticuloso e infraestrutura otimizada.
Isso acelera a criação de IAs mais autônomos e eficientes, que podem realmente executar múltiplos passos e interagir com ambientes virtuais como se fossem humanos. Ao compartilhar os scripts e pesos do modelo, a comunidade de IA ganha ferramentas valiosas para replicar e aprimorar esses resultados, democratizando o acesso a métodos de treinamento de ponta e acelerando a corrida global por inovação em IA.
Linha do tempo
Nova memória proativa eleva sucesso de agentes autônomos em tarefas complexas.
Enxames de Agentes de IA Otimizam o Desenvolvimento de Software e Redefinem a Economia de Modelos.
Ambientes de Reinforcement Learning revolucionam o treinamento de agentes de IA.
Qwen3.8 eleva o patamar da codificação e execução de agentes em IA.
Agent Lightning v1.0: Nova Ferramenta Revoluciona Controle de Agentes de IA.
A Especialização da Tarefa Eleva Performance de Modelos Text-to-SQL com Reforço por IA.
Mercor e SkyRL Elevam Agentes de IA 'Frontier' com Treinamento Inovador.
Perguntas frequentes
O que são "agentes frontier" no contexto de IA?
Agentes "frontier" são modelos de IA que operam nas fronteiras da capacidade atual, capazes de realizar tarefas complexas e de longo prazo que exigem raciocínio, planejamento e interação com múltiplos sistemas, de forma autônoma e eficiente. Eles representam o estado da arte na execução de funções que antes eram exclusivas de humanos.
O que é o benchmark APEX-Agents?
O APEX-Agents é um benchmark que simula tarefas de "knowledge-work" em ambientes realistas, como consultoria de gestão, banca de investimento e direito corporativo. Ele testa a capacidade dos agentes de IA de lidar com desafios complexos que envolvem múltiplos documentos, sistemas e decisões sequenciais.
Qual a importância do Reinforcement Learning (RL) para o treinamento desses agentes?
O Reinforcement Learning é crucial porque permite que os agentes aprendam por tentativa e erro em ambientes complexos, otimizando suas ações para alcançar objetivos específicos. Diferente do treinamento supervisionado, o RL capacita o agente a descobrir as melhores estratégias em cenários dinâmicos e de longo horizonte. O CEVIU noticiou, em 6 de agosto de 2026, a relevância desses ambientes.
Como a contagem de tokens exata ("token accounting") impacta o treinamento?
A contagem de tokens exata, ou TITO, garante que não haja desalinhamento entre o que o modelo de inferência gera e o que o treinador de RL percebe. Sem ela, o treinamento pode ser ineficiente ou até incorreto, pois o agente estaria aprendendo com uma representação distorcida de suas próprias ações e observações.
Fontes
- mercor.comfonte original
- Categoria
- CEVIU IA
- Publicado
- 02 de setembro de 2026
- Editoria
- CEVIU IA

