CEVIU Logo
Voltar

Google impulsiona IA com Gemma 4: Velocidade recorde na geração de texto com Difusão Discreta

Aprofundamento CEVIU

Aprofundamento

O Google DeepMind deu um passo ousado na geração de texto com o DiffusionGemma, um modelo experimental de código aberto que refina o Gemma 4. A grande sacada é a arquitetura de difusão discreta, que permite gerar texto em blocos paralelos de 256 tokens. Isso é diferente do que vimos em modelos autoregressivos tradicionais, que processam um token por vez. O time treinou o DiffusionGemma a partir do Gemma 4, um modelo Mixture-of-Experts com 3.8B de parâmetros ativados e 25.2B totais, usando um pipeline de duas fases: primeiro, um ajuste fino supervisionado para denoise bidirecional, depois um reforço de aprendizado com destilação de sampler. Essa abordagem é eficiente em computação, usando menos de 10% do orçamento de treinamento do modelo autoregressivo original.

O DiffusionGemma não só é rápido, mas também mantém funcionalidades importantes do Gemma 4, como o modo de raciocínio, entradas multimodais e contextos longos. Além disso, mesmo com o ajuste fino para difusão, ele consegue gerar texto de forma autoregressiva com pouca degradação de performance. Isso abre caminho para uma decodificação híbrida, combinando o melhor dos dois mundos.

O que mudou

A grande novidade do DiffusionGemma é a mudança de paradigma na velocidade de geração de texto. Artigos anteriores do CEVIU, como a matéria de 8 de maio de 2026 sobre como o Google acelerou seu LLM Gemma e o de 6 de maio de 2026 sobre Multi-Token Prediction, mostraram que o Gemma 4 já usava decodificação especulativa para ser até 3 vezes mais rápido. Agora, com a difusão discreta, o DiffusionGemma atinge a marca de aproximadamente 1.500 tokens por segundo em uma única NVIDIA H100, um avanço substancialmente mais rápido. A matéria do CEVIU de 11 de junho de 2026 já mencionava o DiffusionGemma e sua capacidade de processar blocos de texto simultaneamente, mas agora temos a quantificação precisa dessa velocidade recorde. Isso significa que o Google não apenas aprimorou a velocidade, mas introduziu uma nova técnica fundamental para chegar lá.

Por que isso importa

Alcançar 1.500 tokens por segundo em uma única GPU NVIDIA H100 redefine o que é possível em termos de eficiência e escalabilidade na geração de conteúdo por IA. Essa velocidade elimina gargalos de decodificação sequencial que limitavam modelos autoregressivos, permitindo respostas quase instantâneas em aplicações em tempo real, como chatbots avançados, criação de conteúdo em massa e assistência de escrita. Para desenvolvedores e empresas, isso se traduz em custos operacionais mais baixos e maior capacidade de processamento, abrindo portas para novos produtos e serviços de IA que antes eram inviáveis devido à latência ou custo. Além disso, a manutenção de capacidades multimodais e suporte a contextos longos torna o DiffusionGemma uma ferramenta versátil e poderosa para o futuro da IA.

Linha do tempo

  1. Gemma 4 recebe 'Drafters de Multi-Token Prediction' para inferência mais rápida.

  2. Google acelera seu LLM Gemma em 3 vezes com decodificação especulativa.

  3. Google lança Gemma 4 12B, modelo multimodal que roda até em laptops.

  4. NVIDIA otimiza o DiffusionGemma para execução em GPUs GeForce RTX e sistemas NVIDIA.

  5. DiffusionGemma, um modelo Mixture of Experts de 26B, atinge geração de texto 4x mais rápida.

  6. Google revela Gemma 4 E2B otimizado para IA on-device no futuro Pixel 10.

  7. Google impulsiona IA com Gemma 4: Velocidade recorde na geração de texto com Difusão Discreta.

Perguntas frequentes

O que é difusão discreta e como ela acelera a geração de texto no DiffusionGemma?

Difusão discreta é uma arquitetura de IA que, em vez de gerar texto token por token, refina blocos maiores (como 256 tokens) em paralelo. Essa abordagem evita o gargalo sequencial dos modelos autoregressivos. No DiffusionGemma, ela permite uma geração significativamente mais rápida, chegando a cerca de 1.500 tokens por segundo.

Qual a diferença entre a aceleração do DiffusionGemma e as otimizações anteriores do Gemma 4?

As otimizações anteriores do Gemma 4, detalhadas no CEVIU News em maio e junho de 2026, usavam decodificação especulativa para acelerar a inferência. O DiffusionGemma, por outro lado, emprega uma arquitetura de difusão discreta. Esta é uma mudança fundamental na forma como o texto é gerado, resultando em ganhos de velocidade ainda maiores do que os alcançados pelas técnicas anteriores.

Quais as implicações práticas da velocidade de 1.500 tokens por segundo para a IA?

Uma velocidade de 1.500 tokens por segundo significa que aplicações de IA podem gerar texto quase em tempo real, melhorando a experiência do usuário em chatbots, assistentes de escrita e ferramentas de criação de conteúdo. Empresas podem processar grandes volumes de texto de forma mais eficiente e econômica. Isso abre novas possibilidades para serviços de IA que exigem baixa latência e alta capacidade de resposta.

O DiffusionGemma substitui completamente os modelos autoregressivos tradicionais?

Não completamente. O artigo técnico aponta que o DiffusionGemma, mesmo após o ajuste fino para difusão, ainda é capaz de geração autoregressiva com uma pequena perda de performance. Isso sugere um caminho para a decodificação híbrida, que pode combinar os benefícios da velocidade da difusão com a capacidade de geração token a token dos modelos autoregressivos, dependendo da necessidade da aplicação.

Fontes

Avalie este artigo:
Compartilhar:
Categoria
CEVIU IA
Publicado
05 de agosto de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser