Voltar
Olmo-core 3 é lançado para Treinamento de Modelos MoE em Escala de Trilhões de Parâmetros

Olmo-core 3 revoluciona treinamento de Modelos MoE em escala de trilhões de parâmetros

Aprofundamento CEVIU

Aprofundamento

Modelos MoE são uma sacada esperta para escalar IAs. Eles permitem modelos gigantescos sem que cada input precise ativar todos os bilhões de parâmetros. É como ter vários especialistas e só chamar o que sabe do assunto. Mas essa eficiência tem um custo: gerenciar a comunicação e coordenação entre esses "especialistas" em um cluster de GPUs é complexo. Olmo-core 3 entra em campo para fechar essa lacuna, redesenhando a forma como esses modelos são treinados.

O framework aposta em várias técnicas para distribuir e otimizar. Isso inclui paralelismo de especialistas, que espalha os modelos entre as GPUs; paralelismo de pipeline, que divide as camadas do modelo; e um otimizador distribuído, que compartilha o estado de treinamento. Para o tráfego de dados, ele usa paralelismo de linha (rowwise expert parallelism) e roteamento residente na GPU, evitando idas e vindas de dados desnecessárias. Agrupa operações pequenas (grouped GEMM) para GPUs processarem mais rápido e ainda suporta MXFP8, um formato de número de menor precisão. Essa combinação economiza computação e transferência de dados, otimizando o throughput em cerca de 21% em testes.

O que mudou

Olmo-core 3 representa um salto evolutivo claro para o ecossistema Olmo. O sistema anterior usava FSDP (fully sharded data parallelism) para a implementação MoE. Essa abordagem exigia reunir e redistribuir pesos do modelo a cada pequeno lote de dados. A nova versão trocou para DDP (distributed data parallelism), mantendo os especialistas residentes nas GPUs e roteando os dados relevantes diretamente, evitando o custo de re-gathering. Essa mudança foi drástica: em testes, a nova arquitetura obteve um throughput 2,7 vezes maior, passando de 19.400 para 52.000 tokens por segundo por GPU em um MoE de 47 bilhões de parâmetros, comparado à implementação anterior baseada em FSDP.

Por que isso importa

A capacidade do Olmo-core 3 de escalar MoE para trilhões de parâmetros, com uso otimizado de recursos computacionais, é crucial. Isso significa que desenvolver IAs massivas se torna mais acessível e barato, democratizando o acesso para pesquisadores acadêmicos e laboratórios menores. Muitas vezes eles não têm o poder de computação das grandes empresas. Modelos como o Kimi K3, discutido em nossa cobertura de 29 de julho de 2026, que já atingiu 2.8 trilhões de parâmetros, mostram a direção do mercado. Soluções como o Olmo-core 3, junto com outros projetos como o "Mixture-of-Kittens" da Cursor, mencionado em 5 de agosto de 2026, impulsionam a corrida global por inovação em IA de larga escala, acelerando a chegada de sistemas inteligentes mais capazes e eficientes.

Linha do tempo

  1. Ramp Labs inova com PorTAL: Adaptação de LoRA entre Modelos para Otimizar Tarefas de IA

  2. Kimi K3: Um Modelo Open-Weight Mais Eficiente e Escalável Com Inovações na Arquitetura

  3. Moonshot Revela Kimi K3: Um Gigante de IA com Capacidade Visual e Arquitetura Inovadora

  4. Cursor lança 'Mixture-of-Kittens': o megakernel open-source que turbina modelos de IA

  5. Muse Glimmer: Novo Modelo de 30B Promete Revolucionar Autonomia de Agentes com IA

  6. Desvendando a Escalabilidade de MoEs: Novas Técnicas Revolucionam Treinamento em GPUs

  7. Olmo-core 3 revoluciona treinamento de Modelos MoE em escala de trilhões de parâmetros

Perguntas frequentes

O que são Modelos Mixture-of-Experts (MoE) e por que são importantes?

MoE são arquiteturas de IA que dividem a tarefa de processamento entre vários "especialistas", ativando apenas um subconjunto deles para cada input. Isso permite construir modelos com trilhões de parâmetros, enquanto mantém o custo computacional por token ativo relativamente baixo, otimizando o treinamento de IAs gigantescas.

Como Olmo-core 3 consegue treinar modelos MoE com trilhões de parâmetros de forma eficiente?

O Olmo-core 3 combina técnicas como paralelismo de especialistas, pipeline e otimizadores distribuídos para dividir o modelo e o estado de treinamento entre as GPUs. Ele também otimiza o roteamento de dados, mantém metadados residentes nas GPUs e usa formatos de menor precisão como MXFP8 para reduzir custos de comunicação e computação.

Quais as vantagens de um framework de IA como Olmo-core 3 ser de código aberto?

Um framework de código aberto como o Olmo-core 3 democratiza o acesso a ferramentas avançadas para desenvolver e treinar IAs em larga escala. Isso permite que pesquisadores e desenvolvedores adaptem a tecnologia, experimentem com novas abordagens e acelerem o progresso científico, como já visto em outras iniciativas open-source na área de modelos MoE.

Em que o Olmo-core 3 se diferencia de outras soluções para treinamento de MoE?

Olmo-core 3 oferece uma stack de treinamento MoE integrada e redesenhada, que melhora drasticamente o throughput em comparação com suas implementações anteriores. Enquanto o Megatron-Core da NVIDIA também é uma opção para grandes MoEs, o Olmo-core 3 foca em uma abordagem open-source com otimizações específicas para os desafios de comunicação e coordenação em modelos MoE de larga escala.

Fontes

Avalie este artigo:
Categoria
CEVIU IA
Publicado
02 de outubro de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser