Voltar
Guia de treinamento para agentes de IA frontier com 397B, usando RL e SkyRL

Mercor e SkyRL Elevam Agentes de IA 'Frontier' com Treinamento Inovador

Aprofundamento CEVIU

Aprofundamento

A Mercor e a SkyRL deram um passo e tanto no treinamento de modelos de IA, elevando a capacidade dos chamados "agentes frontier". Usaram o Qwen3.5-397B-A17B para um pós-treinamento focado em tarefas complexas de "knowledge-work", como consultoria de gestão, banca de investimento e direito empresarial. O segredo não foi só o algoritmo, mas uma infraestrutura de treinamento robusta, que incluiu ambientes controlados, controle preciso de tokens e Reinforcement Learning assíncrono.

O resultado foi um aumento de 70% no desempenho APEX-Agents Pass@1, um benchmark de 1.928 tarefas de trabalho do conhecimento. Este é um salto enorme para a autonomia dos agentes, mostrando que otimizar o ambiente de treinamento, o design do harness (a interface do agente com o ambiente) e a contagem de tokens exata são tão cruciais quanto o próprio modelo. A experimentação mostrou que refinar esses elementos pode render ganhos equivalentes a um ciclo inteiro de treinamento.

O que mudou

A Mercor e a SkyRL vêm aprimorando seu método de pós-treinamento há algum tempo. Em janeiro, eles já tinham mostrado que poucas tarefas rotuladas por especialistas podiam quase dobrar a pontuação de um modelo open-weight no APEX-Agents. Em fevereiro, escalaram o dataset para quase 2.000 casos, com o modelo Applied Compute: Small, treinado a partir do GLM-4.7 355B, alcançando a liderança em direito corporativo.

A diferença agora é a abertura da receita: eles reproduzem esses ganhos com o SkyRL público, estendendo-os ao modelo de 397 bilhões de parâmetros, o Qwen3.5-397B-A17B, e liberam o script de treinamento completo, os pesos do modelo e os rastros de avaliação. Além disso, a família Qwen continua em evolução; o CEVIU noticiou, em 13 de agosto de 2026, o lançamento do Qwen3.8, que é baseado na arquitetura do Qwen3.5 e promete melhorias significativas na execução de agentes. Este trabalho atual com o Qwen3.5-397B-A17B demonstra um avanço prático e validado, enquanto a versão 3.8 já aponta para o próximo nível de capacidades.

Por que isso importa

A capacidade de agentes de IA lidarem com tarefas complexas de "knowledge-work" representa um avanço tremendo. Pense em automação de processos em consultoria, direito ou finanças. A metodologia da Mercor e SkyRL mostra que não basta ter um modelo grande; é preciso um processo de treinamento meticuloso e infraestrutura otimizada.

Isso acelera a criação de IAs mais autônomos e eficientes, que podem realmente executar múltiplos passos e interagir com ambientes virtuais como se fossem humanos. Ao compartilhar os scripts e pesos do modelo, a comunidade de IA ganha ferramentas valiosas para replicar e aprimorar esses resultados, democratizando o acesso a métodos de treinamento de ponta e acelerando a corrida global por inovação em IA.

Linha do tempo

  1. Nova memória proativa eleva sucesso de agentes autônomos em tarefas complexas.

  2. Enxames de Agentes de IA Otimizam o Desenvolvimento de Software e Redefinem a Economia de Modelos.

  3. Ambientes de Reinforcement Learning revolucionam o treinamento de agentes de IA.

  4. Qwen3.8 eleva o patamar da codificação e execução de agentes em IA.

  5. Agent Lightning v1.0: Nova Ferramenta Revoluciona Controle de Agentes de IA.

  6. A Especialização da Tarefa Eleva Performance de Modelos Text-to-SQL com Reforço por IA.

  7. Mercor e SkyRL Elevam Agentes de IA 'Frontier' com Treinamento Inovador.

Perguntas frequentes

O que são "agentes frontier" no contexto de IA?

Agentes "frontier" são modelos de IA que operam nas fronteiras da capacidade atual, capazes de realizar tarefas complexas e de longo prazo que exigem raciocínio, planejamento e interação com múltiplos sistemas, de forma autônoma e eficiente. Eles representam o estado da arte na execução de funções que antes eram exclusivas de humanos.

O que é o benchmark APEX-Agents?

O APEX-Agents é um benchmark que simula tarefas de "knowledge-work" em ambientes realistas, como consultoria de gestão, banca de investimento e direito corporativo. Ele testa a capacidade dos agentes de IA de lidar com desafios complexos que envolvem múltiplos documentos, sistemas e decisões sequenciais.

Qual a importância do Reinforcement Learning (RL) para o treinamento desses agentes?

O Reinforcement Learning é crucial porque permite que os agentes aprendam por tentativa e erro em ambientes complexos, otimizando suas ações para alcançar objetivos específicos. Diferente do treinamento supervisionado, o RL capacita o agente a descobrir as melhores estratégias em cenários dinâmicos e de longo horizonte. O CEVIU noticiou, em 6 de agosto de 2026, a relevância desses ambientes.

Como a contagem de tokens exata ("token accounting") impacta o treinamento?

A contagem de tokens exata, ou TITO, garante que não haja desalinhamento entre o que o modelo de inferência gera e o que o treinador de RL percebe. Sem ela, o treinamento pode ser ineficiente ou até incorreto, pois o agente estaria aprendendo com uma representação distorcida de suas próprias ações e observações.

Fontes

Avalie este artigo:
Categoria
CEVIU IA
Publicado
02 de setembro de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser