CEVIU Logo
Voltar
DFlash 2 otimiza decodificação especulativa e acelera inference de LLMs em 3x

DFlash 2 revoluciona inferência de LLMs com decodificação especulativa aprimorada

Aprofundamento CEVIU

Aprofundamento

O DFlash 2 aprimora a decodificação especulativa, um método onde um modelo "rascunho" (draft model) sugere um bloco de tokens para o modelo principal verificar de uma vez. O DFlash original já tornava essa etapa de rascunho paralela. O DFlash 2 agora foca em dois pontos-chave: a seleção de caminho (path selector) e a redução do decaimento do sufixo (suffix decay).

O path selector melhora a coerência dos tokens propostos. Ele escolhe o token mais adequado dentre os candidatos já gerados pelo drafter, sem precisar de correções autoregressivas caras. Isso é feito com um score leve para pares adjacentes de tokens. Já a correção do suffix decay usa uma convolução local leve para tratar dependências dentro do bloco de tokens. Isso combate a queda de precisão no final do rascunho, sem adicionar a complexidade de mais camadas de transformadores.

O que mudou

A cobertura anterior do CEVIU, em **9 de fevereiro de 2026** e **16 de junho de 2026**, detalhou o impacto do DFlash original. Ele levou a decodificação especulativa a um novo patamar, permitindo que o rascunho de tokens ocorresse em paralelo, não mais um token por vez. O DFlash 2 avança nessa premissa, refinando a qualidade e a extensão dos rascunhos.

Com o DFlash original, a verificação muitas vezes cortava o rascunho se ele se tornasse incoerente. Agora, com o DFlash 2, um mecanismo de seleção de caminho e uma convolução local garantem que o modelo aceite blocos mais longos e coerentes, entregando cerca de 20% mais output por passagem. A notícia atual aponta que o DFlash original, mencionado em nossa cobertura de **9 de fevereiro de 2026**, já acumulava mais de 3.5 milhões de downloads até **agosto de 2026**. Ele era adotado por grandes players como Nvidia e Google. A evolução para o DFlash 2 aprofunda os ganhos dessa tecnologia já consolidada no mercado.

Por que isso importa

A inferência de Large Language Models (LLMs) é um gargalo na "era dos agentes" de IA. Nela, o consumo de tokens é massivo. Acelerar esse processo, sem perder qualidade, é fundamental para reduzir custos e viabilizar aplicações em larga escala. O DFlash 2, ao aumentar a taxa de tokens por segundo em até três vezes comparado à decodificação autoregressiva tradicional, representa um salto na eficiência computacional.

Isso significa que mais tarefas complexas podem ser executadas com IA, mais rapidamente e com menos recursos. Isso impacta diretamente o desenvolvimento de agentes autônomos e sistemas de IA conversacionais que demandam alta performance e respostas em tempo real.

Linha do tempo

  1. DFlash Impulsiona a Velocidade do Speculative Decoding em LLMs

  2. Acelerando Gemma 4: Inference Mais Veloz com Drafters de Multi-Token Prediction

  3. Como o Google Acelerou seu LLM Gemma em 3 Vezes

  4. DFlash e Spec V2 revolucionam a speculative decoding com ganhos de throughput expressivos

  5. DFlash 2 revoluciona inferência de LLMs com decodificação especulativa aprimorada

Perguntas frequentes

O que é decodificação especulativa?

É uma técnica para acelerar a inferência de Large Language Models. Um modelo menor e mais rápido (o drafter) gera um rascunho de tokens em bloco, que é então validado de uma vez pelo modelo principal. Isso evita que o modelo principal precise gerar um token por vez, economizando tempo computacional.

Qual a principal inovação do DFlash 2?

O DFlash 2 aprimora a decodificação especulativa paralela introduzida pelo DFlash original. Ele adiciona um "path selector" para melhorar a coerência dos tokens rascunhados e uma "convolução local" para combater o decaimento da precisão no final dos blocos, resultando em blocos de tokens mais longos e precisos por passagem.

Como o DFlash 2 impacta a performance de LLMs?

Ele promete acelerar a inferência de LLMs em até três vezes, mantendo a qualidade da saída. Isso significa que aplicações baseadas em IA podem gerar respostas mais rapidamente e processar mais informações, o que é crucial para agentes de IA que consomem muitos tokens e para reduzir os custos operacionais.

O DFlash 2 funciona com quais modelos e engines de inferência?

O DFlash 2 já está integrado em engines de inferência populares como SGLang, vLLM e TensorRT-LLM. A Inco AI já lançou drafters específicos para modelos como Qwen3.8-27B e Meta's Muse Glimmer, indicando ampla compatibilidade com modelos de IA atuais.

Fontes

Avalie este artigo:
Categoria
CEVIU Dados
Publicado
20 de agosto de 2026
Editoria
CEVIU Dados

Quer receber mais sobre CEVIU Dados?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser