Voltar
VLLM lança versão 0.28.0, incorporando 584 novos commits

VLLM Anuncia Nova Versão 0.28.0 com Colaboração Massiva da Comunidade

Aprofundamento CEVIU

Aprofundamento

A nova versão 0.28.0 do vLLM, um dos pilares para a inferência de modelos de linguagem de grande escala (LLMs), chegou com uma série de aprimoramentos que reverberam na performance e na acessibilidade. O framework é fundamental para quem busca rodar LLMs de forma eficiente, seja otimizando o uso de GPU, acelerando o tempo de resposta ou expandindo a compatibilidade com diferentes arquiteturas de hardware. Os 584 commits e 270 colaboradores nesta versão solidificam a abordagem de desenvolvimento comunitário, trazendo inovações que vão desde a otimização de modelos específicos até o suporte a novos hardwares.

As novidades incluem um esforço significativo de otimização para o Kimi-K3, com melhorias em Decode Context Parallel (DCP), kernels fundidos de FlashKDA e suporte a SiTU activation. Para o DeepSeek V4, a versão traz sparse MLA e compatibilidade com AMD Quark NVFP4. Há também avanços na decodificação especulativa com DFlash2 e DSpark, além da maturação do Model Runner V2 com desagregação E/P/D e offloading de pesos. A capacidade de offloading de cache KV em camadas, incluindo para disco, é outro destaque, juntamente com um frontend Rust aprimorado que suporta inferência multimodal de imagens via gRPC. As mudanças de defaults, como o aumento do max_num_batched_tokens para 16384, indicam um foco claro em escalabilidade e desempenho.

O que mudou

A nova versão 0.28.0 do vLLM traz um avanço significativo no suporte e otimização de modelos de IA que o CEVIU News já acompanhou. A cobertura de 29 de julho de 2026 sobre o Kimi K3, da Moonshot, destacou o modelo como um gigante MoE de 2.8 trilhões de parâmetros. Agora, o vLLM 0.28.0 oferece um grande impulso de performance para o Kimi-K3, incluindo suporte no ROCm da AMD, mostrando uma evolução na capacidade de rodar este modelo complexo com maior eficiência. Além disso, a matéria de 11 de julho de 2026 sobre o Gemma 4, da Google, que introduziu modelos multimodais open-weight, vê agora o vLLM integrar suporte a LoRA para Gemma 4 e garantir compatibilidade com futuras versões do Transformers. Para o Qwen 3.8-Max, que abordamos em 3 de agosto de 2026 como um modelo que redefine colaboração e codificação, o vLLM 0.28.0 habilita seu uso em hardwares AMD ROCm, ampliando seu alcance e otimizando a execução.

Por que isso importa

Esta atualização do vLLM é um passo importante para a democratização e a eficiência da inferência de LLMs. A ampla colaboração da comunidade não só garante um desenvolvimento rápido e robusto, como também incorpora diversas perspectivas e necessidades. Para desenvolvedores e empresas, significa acesso a otimizações de ponta que reduzem custos operacionais e aumentam a velocidade das aplicações de IA. A expansão do suporte a novos modelos e hardwares, como AMD e Intel, abre portas para um ecossistema de IA mais diverso e competitivo. Em última análise, a versão 0.28.0 melhora o desempenho, a estabilidade e a versatilidade, impulsionando a próxima geração de aplicações baseadas em IA generativa.

Linha do tempo

  1. Meta lança Muse Spark 1.1, um novo modelo multimodal para tarefas agentic.

  2. Gemma 4 é lançado, com uma nova geração de modelos multimodais open-weight.

  3. Moonshot revela Kimi K3, um modelo Mixture-of-Experts de 2.8 trilhões de parâmetros.

  4. Qwen 3.8-Max é lançado, prometendo melhorias em codificação e produtividade com IA.

  5. vLLM anuncia a versão 0.28.0, com foco em colaboração massiva e otimizações de inferência para LLMs.

Perguntas frequentes

O que é o vLLM e qual sua principal função?

O vLLM é um framework de inferência de modelos de linguagem de grande escala (LLMs). Sua principal função é otimizar a execução desses modelos, entregando alta performance e throughput para diversas aplicações de IA generativa. Ele gerencia eficientemente recursos de hardware, especialmente GPUs.

Quais são as principais melhorias de performance na versão 0.28.0?

A versão 0.28.0 traz otimizações para modelos como Kimi-K3 e DeepSeek V4, avanços em decodificação especulativa com DFlash2 e DSpark, e melhorias no Model Runner V2. Há também a implementação de offloading de cache KV para disco e o aumento do limite de tokens por lote, tudo visando maior velocidade e menor latência na inferência.

Quais novos modelos e hardwares recebem suporte no vLLM 0.28.0?

A nova versão adiciona suporte para modelos como Muse Glimmer, Ling 3.0 Flash, Dots3 NOTE e Interns2mobius. Em termos de hardware, há melhorias significativas para GPUs NVIDIA (com FlashInfer XQA e CuTeDSL), AMD ROCm (com suporte para Qwen 3.8 e DeepSeek V4) e Intel XPU, além de otimizações para CPUs.

Por que a colaboração da comunidade é importante para o vLLM?

A colaboração massiva da comunidade, com 270 contribuidores nesta versão, é vital porque acelera o desenvolvimento, integra uma gama maior de insights e garante que o framework atenda a diversas necessidades do ecossistema de IA. Isso resulta em um produto mais robusto, versátil e alinhado com as tendências e desafios da inferência de LLMs.

Fontes

Avalie este artigo:
Categoria
CEVIU IA
Publicado
31 de agosto de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser