Voltar
Google disponibiliza ML Drift, um motor de GPU para múltiplas APIs gráficas

Google Lança ML Drift para Otimizar Inferência de IA em GPUs

Aprofundamento CEVIU

Aprofundamento

O ML Drift do Google chega para resolver um desafio central na inferência de IA em dispositivos de borda: a fragmentação de hardware. Diferente dos datacenters, onde os aceleradores são homogêneos, o edge computing lida com uma vasta gama de GPUs, drivers e APIs. A inovação do ML Drift reside na virtualização de tensores, que desacopla a representação lógica dos dados da sua alocação física na GPU. Isso permite que um único template de shader funcione em diversas APIs gráficas (OpenCL, Metal, WebGPU, OpenGL ES), simplificando o desenvolvimento e garantindo portabilidade sem comprometer a performance. Essa abordagem é crucial para rodar modelos cada vez mais complexos, como os LLMs e redes neurais 3D, diretamente em celulares e outros dispositivos com recursos limitados.

A co-otimização com fabricantes de silício como Arm, Intel e Qualcomm é um ponto chave. O ML Drift foi desenvolvido para aproveitar ao máximo as arquiteturas de GPU existentes, garantindo que as otimizações de software se traduzam em eficiência energética e alta taxa de quadros. Para LLMs, o motor alterna dinamicamente os kernels e layouts de cache, usando um layout de KV cache alinhado a convoluções e quantização de ativação in-kernel. Essa técnica reduz o tráfego de memória, um gargalo comum em modelos de linguagem grandes, e alinha-se com a busca por modelos mais leves e eficientes para execução local, como o CEVIU News noticiou sobre o lançamento do Gemma 4 com QAT em junho de 2026.

O que mudou

O ML Drift representa uma evolução significativa em relação ao antigo delegado de GPU do TensorFlow Lite. Antes, os desenvolvedores precisavam manter códigos de shader específicos para cada backend gráfico (OpenGL, OpenCL, Metal), e o suporte a tensores era limitado a 4D, exigindo gambiarras para modelos mais complexos. O ML Drift unifica isso com a virtualização de tensores e introduz suporte nativo a tensores 5D, permitindo a execução direta de redes convolucionais 3D e modelos espaciotemporais. Essa modernização é fundamental para o cenário atual, onde modelos de IA generativa e multimodais exigem mais flexibilidade.

Em termos práticos, enquanto a cobertura anterior do CEVIU News, como em junho de 2026, mostrava o Google e a NVIDIA otimizando modelos como o Gemma e o DiffusionGemma para execução local com técnicas como QAT, o ML Drift entrega a infraestrutura de runtime de GPU para que esses modelos rodem de fato com desempenho máximo. Ele é a peça que permite que os avanços em modelos de IA e suas otimizações de quantização sejam plenamente aproveitados no hardware do usuário final, oferecendo uma fundação unificada para modelos clássicos e de próxima geração.

Por que isso importa

Para o ecossistema de desenvolvimento, o ML Drift simplifica a criação de experiências de IA em tempo real e interativas em diversas plataformas, desde efeitos de vídeo avançados até IA generativa. Ao abstrair as complexidades de hardware e APIs de baixo nível, desenvolvedores podem focar na lógica do modelo, sabendo que terão performance otimizada. Para o usuário final, isso se traduz em funcionalidades de IA mais rápidas e fluidas em seus dispositivos. Reduções de latência de até 40% em aplicativos como YouTube Shorts e ganhos de velocidade em edição de fotos no Google Fotos e Adobe Lightroom mostram o impacto direto na experiência do usuário.

Além disso, o lançamento como código aberto sob a licença Apache 2.0 incentiva a colaboração e a inovação na comunidade. Isso consolida a estratégia do Google de democratizar o acesso à IA de alto desempenho na borda, permitindo que mais desenvolvedores e empresas criem aplicações de IA que rodam eficientemente em milhões de dispositivos, impulsionando a próxima geração de aplicativos inteligentes.

Linha do tempo

  1. Google lança Gemma 4 12B, modelo multimodal otimizado para laptops.

  2. Google lança Gemma 4 com QAT para IA mais eficiente em celulares e notebooks.

  3. NVIDIA acelera o DiffusionGemma do Google DeepMind para IA local em GPUs RTX.

  4. Google lança ML Drift, motor de GPU de código aberto para otimizar inferência de IA em dispositivos de borda.

Perguntas frequentes

O que é o ML Drift do Google?

ML Drift é um motor de computação de GPU de código aberto e multiplataforma, desenvolvido pelo Google para otimizar a inferência de IA e Machine Learning diretamente em dispositivos de borda. Ele foi projetado para abstrair as complexidades do hardware e das APIs gráficas, permitindo que os modelos de IA rodem de forma mais eficiente.

Como o ML Drift melhora a performance de IA em dispositivos de borda?

Ele melhora a performance por meio da virtualização de tensores, que desacopla o layout lógico da alocação física na GPU, permitindo shaders unificados. Para LLMs, otimiza a alternância entre kernels e utiliza um layout de cache de chave-valor (KV cache) e quantização in-kernel, reduzindo o tráfego de memória. Também oferece suporte a tensores 5D e é co-otimizado com GPUs de fabricantes como Arm, Intel e Qualcomm.

Quais ganhos de desempenho o ML Drift já demonstrou na prática?

Em testes e uso em produção, o ML Drift reduziu a latência de quadros em até 40% no YouTube Shorts e acelerou recursos no Google Fotos em até 2 segundos. Parceiros como Adobe e Snap também viram melhorias significativas, com o Adobe Lightroom e Photoshop ficando até 30% mais rápidos e o Snapchat registrando 30% de melhoria na latência de modelos.

Qual a relação do ML Drift com o TensorFlow Lite GPU delegate?

O ML Drift é o sucessor direto do legado TensorFlow Lite GPU delegate. Ele foi construído para superar as limitações do antecessor, oferecendo uma arquitetura mais moderna, suporte a tensores 5D e otimizações específicas para IA generativa e LLMs. O Google incentiva todos os desenvolvedores a migrarem para o ML Drift, que é retrocompatível e oferece ganhos de desempenho imediatos.

Fontes

Avalie este artigo:
Categoria
CEVIU Hardware
Publicado
09 de outubro de 2026
Editoria
CEVIU Hardware

Quer receber mais sobre CEVIU Hardware?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser

IA aplicada na indústria

No CEVIU Experts, quem conhece um setor por dentro e sabe aplicar IA nele fica visível para as empresas que precisam resolver um problema ali.

Você trabalha com IA na indústria?

Sua ficha reúne o setor que você conhece, as competências de IA que domina e o que mostra como prova. Publicar depende só de você.

Tem um problema parecido para resolver?

Descreva o que a sua empresa precisa resolver e publique como demanda. Procurar direto entre os Experts de Indústria também é caminho.