NVIDIA Apresenta Nemotron 3.5 Lightning: Um MoE de 30B Otimizado para Agentes de IA
Aprofundamento CEVIU
Aprofundamento
A NVIDIA acaba de expandir sua família Nemotron com o Nemotron 3.5 Lightning, um modelo de linguagem grande (LLM) que adota uma arquitetura híbrida de Mixture-of-Experts (MoE), intercalando camadas Mamba-2 e MoE com camadas de Attention. Embora o modelo total possua 30 bilhões de parâmetros, ele opera de forma otimizada com apenas 3 bilhões de parâmetros ativos. Essa configuração é pensada para entregar alta performance e baixa latência, sendo ideal para o desenvolvimento de agentes de IA de longa duração.
O Nemotron 3.5 Lightning foi treinado com mais de 20 trilhões de tokens e suporta uma janela de contexto de até 1 milhão de tokens. A NVIDIA o projetou para uso comercial, com suporte a idiomas como inglês, espanhol, francês, alemão, italiano e japonês, além de 43 linguagens de programação. Sua otimização para hardware NVIDIA (Blackwell, Hopper, Ampere) através do uso de quantização NVFP4 e métodos de decodificação especulativa como DSpark e MTP, garante eficiência em diversos cenários, desde data centers até aplicações interativas.
O que mudou
O lançamento do Nemotron 3.5 Lightning sinaliza uma estratégia clara da NVIDIA para diversificar sua linha de modelos Nemotron, oferecendo opções otimizadas para diferentes casos de uso. Vimos o Nemotron 3 Super em março de 2026 com 120 bilhões de parâmetros (12B ativos) e o Nemotron Ultra 550B em junho de 2026 com 550 bilhões (55B ativos). Agora, o 3.5 Lightning se posiciona com uma pegada menor, 30 bilhões (3B ativos), visando eficiência e menor latência, um passo lógico para agentes de IA que demandam respostas rápidas.
A arquitetura híbrida com Mamba-2 e MoE layers, que já tinha sido introduzida no Nemotron 3 Nano Omni em abril de 2026, é aqui refinada e combinada com decodificação especulativa (como DSpark, DFlash e MTP). Esses métodos são novidades que prometem acelerar a geração de texto. Enquanto o foco em agentes de IA já aparecia no Nemotron 3 Super, o Lightning se especializa em agentes "de longa duração", um avanço no tipo de autonomia que esses sistemas podem ter.
Por que isso importa
A chegada do Nemotron 3.5 Lightning é estratégica para a NVIDIA e para o ecossistema de IA. Com sua arquitetura otimizada para performance e baixa latência, ele oferece uma ferramenta poderosa e acessível para desenvolvedores que trabalham com agentes de IA, especialmente aqueles que precisam de resiliência em tarefas complexas e contínuas. A oferta de modelos de "open weights" e a otimização para o próprio hardware solidificam a posição da NVIDIA não só como provedora de infraestrutura, mas também como um player central no desenvolvimento de modelos de IA.
Este lançamento, em conjunto com os outros modelos da família Nemotron (Ultra, Super, Nano Omni, Embed), mostra que a NVIDIA está construindo um ecossistema completo de ferramentas para IA, do chip ao software. Isso impulsiona a inovação, permitindo que mais desenvolvedores criem agentes de IA mais inteligentes e eficientes, acelerando a adoção da IA em diversos setores e consolidando as plataformas da NVIDIA como o padrão para desenvolvimento e operação de IA.
Linha do tempo
NVIDIA lança Nemotron 3 Super: Modelo MoE Híbrido para Sistemas de IA Avançados.
NVIDIA apresenta Nemotron 3 Nano Omni: Inteligência Multimodal de Contexto Longo para Agentes de Documentos, Áudio e Vídeo.
NVIDIA lança Nemotron Ultra 550B: o modelo open weights mais capaz dos EUA.
NVIDIA lança Nemotron 3 Embed: modelos open-source de embedding que redefinem o RAG.
NVIDIA apresenta Cosmos 3 Edge: Um Salto para Robôs Autônomos com IA de Visão.
Muse Glimmer: Novo Modelo de 30B Promete Revolucionar Autonomia de Agentes com IA.
NVIDIA Apresenta Nemotron 3.5 Lightning: Um MoE de 30B Otimizado para Agentes de IA.
Perguntas frequentes
O que é o Nemotron 3.5 Lightning?
É um modelo de linguagem grande (LLM) da NVIDIA com arquitetura híbrida Mixture-of-Experts (MoE) que possui 30 bilhões de parâmetros totais, mas opera com 3 bilhões de parâmetros ativos. Ele é otimizado para performance, baixa latência e para ser usado em agentes de IA, suportando uma janela de contexto de até 1 milhão de tokens.
Como a arquitetura MoE e Mamba-2 contribuem para o desempenho?
A arquitetura MoE permite que o modelo ative apenas uma parte de seus parâmetros para uma dada tarefa, resultando em menor custo computacional e maior velocidade. A integração das camadas Mamba-2, conhecida por sua eficiência em processamento de sequências longas, junto com camadas de Attention, otimiza ainda mais a capacidade do modelo de lidar com contextos extensos e complexos, mantendo a performance.
Quais são as principais aplicações do Nemotron 3.5 Lightning?
Ele é ideal para desenvolver agentes de IA de longa duração, chatbots, sistemas de Recuperação Aumentada por Geração (RAG) e outras aplicações que exigem raciocínio complexo e capacidade de seguir instruções. O modelo também suporta tarefas de codificação e conversação em múltiplos idiomas.
O que são os métodos de decodificação especulativa mencionados?
DSpark, DFlash e MTP (Multi-Token Prediction) são técnicas para acelerar a geração de texto em LLMs. Eles permitem que o modelo proponha e valide múltiplos tokens futuros de uma só vez, ou preveja vários tokens, em vez de um por um, reduzindo significativamente a latência e aumentando o throughput em inferência.
Fontes
- huggingface.cofonte original
- Categoria
- CEVIU IA
- Publicado
- 12 de agosto de 2026
- Editoria
- CEVIU IA

