Voltar
Executando LLMs Diretamente no Navegador com Three.js e WebGPU

Three-LLM Viabiliza LLMs no Navegador com WebGPU e Three.js

Aprofundamento CEVIU

Aprofundamento

O projeto Three-LLM representa um avanço significativo na execução de Large Language Models (LLMs) diretamente no navegador, explorando a capacidade de computação geral da WebGPU via Three.js. A iniciativa transforma grafos de inferência de LLMs, como GPT-2, SmolLM2, Qwen e Phi, em compute shaders TSL (Three.js Shading Language) para WebGPU. Isso elimina a dependência de um runtime de inferência server-side, carregando configurações, tokenizers e SafeTensors diretamente do Hugging Face. A arquitetura de um LLM, da tokenização à amostragem, é mapeada para sequências de kernels TSL, que incluem operações como multiplicação matriz-vetor (TSLLinear), normalização (TSLNormalize, TSLRMSNorm), atenção (TSLAttention) e MLPs (TSLMLP, TSLGatedMLP).

As otimizações são cruciais para a performance. Por exemplo, a submissão de um único comando para o forward pass de um LLM, que anteriormente exigia mais de 400 submissões separadas, impulsionou a decodificação de TinyStories de 120 para 566 tokens por segundo. Outras melhorias incluem evitar o cálculo de logits de vocabulário desnecessários durante o prefill e a redução da amostragem (sampling) na GPU, que move a lógica de seleção de tokens para o hardware gráfico, minimizando o gargalo de leitura de dados para o JavaScript. Diferentes arquiteturas de LLMs são suportadas através de recipes flexíveis, adaptando-se a características como Rotary Position Embeddings (RoPE), Grouped-Query Attention e Gated DeltaNet, que usam estado recorrente para gerenciar memória.

O que mudou

A execução de LLMs no navegador não é uma novidade absoluta. O CEVIU News já cobriu, em fevereiro de 2026, a prévia do Transformers.js v4 com um novo WebGPU Runtime. Mais recentemente, em setembro de 2026, noticiamos que a Hugging Face liberou 207 kernels WebGPU otimizados. O Three-LLM, porém, mostra uma evolução na integração e na abordagem. Enquanto as coberturas anteriores focavam em runtimes gerais ou bibliotecas de kernels, o Three-LLM demonstra como uma biblioteca de renderização 3D como o Three.js pode ser estendida para se tornar uma plataforma de computação generalista para IA, traduzindo grafos de inferência de modelos diretamente em shaders.

A principal mudança está na tangibilidade de rodar modelos complexos como Qwen e Phi diretamente no navegador, de ponta a ponta, sem a necessidade de conversão offline ou runtimes específicos de modelo. Isso representa um passo adiante na concretização da IA verdadeiramente client-side, utilizando a infraestrutura da WebGPU de uma maneira inovadora e altamente performática, algo que as discussões sobre “executar modelos locais” (junho de 2026) apontavam como futuro, e que agora o Three-LLM entrega de forma pragmática para o ambiente web.

Por que isso importa

A execução de LLMs diretamente no navegador tem implicações profundas para desenvolvedores e para o futuro das aplicações web. Primeiro, promove a privacidade e a segurança, mantendo os dados do usuário localmente. Segundo, reduz significativamente os custos de infraestrutura, eliminando a necessidade de servidores de inferência dedicados para muitas aplicações. Terceiro, abre caminho para experiências de usuário mais fluidas e responsivas, com latência mínima e funcionalidade offline.

Para a comunidade de desenvolvimento, é um catalisador para a criação de novas categorias de aplicações web, desde ferramentas de produtividade com IA integrada até jogos e experiências interativas que podem gerar conteúdo em tempo real usando modelos de linguagem. Também demonstra o crescente poder da WebGPU e da computação paralela no navegador, incentivando a exploração de bibliotecas como Three.js para além de suas funções tradicionais de renderização.

Linha do tempo

  1. Transformers.js v4 Preview: Já Disponível no NPM! (WebGPU Runtime)

  2. Executar modelos locais virou realidade prática para devs

  3. FreeToken Otimiza Modelos MoE em Dispositivos Pessoais

  4. DFlash 2 revoluciona inferência de LLMs com decodificação especulativa aprimorada

  5. Decodificação Especulativa: O Segredo para Acelerar LLMs em até 3 Vezes

  6. Hugging Face impulsiona IA no navegador com 207 kernels WebGPU otimizados

  7. Three-LLM Viabiliza LLMs no Navegador com WebGPU e Three.js

Perguntas frequentes

O que é o Three-LLM?

Three-LLM é um projeto inovador que permite rodar Large Language Models (LLMs) como GPT-2 e Qwen diretamente no navegador. Ele faz isso traduzindo os grafos de inferência dos modelos em compute shaders TSL, executados via WebGPU e Three.js, eliminando a necessidade de um servidor de inferência.

Quais modelos de LLM são compatíveis com o Three-LLM?

O Three-LLM é compatível com diversos modelos de LLM, incluindo GPT-2, SmolLM2, Qwen e Phi. Ele carrega as configurações, tokenizers e SafeTensors desses modelos diretamente do Hugging Face, suportando diferentes arquiteturas como as de estilo Llama e Qwen3.5.

Como o Three-LLM alcança alta performance no navegador?

A alta performance do Three-LLM se deve a otimizações como a submissão de um único comando para o forward pass dos modelos, que reduz a sobrecarga da CPU. Ele também evita o cálculo de logits desnecessários e realiza a amostragem (sampling) na GPU, liberando a CPU e aproveitando ao máximo a capacidade de computação paralela da WebGPU.

Qual o principal benefício do Three-LLM para desenvolvedores?

Para desenvolvedores, o principal benefício é a capacidade de criar aplicações web com funcionalidades de IA avançadas, rodando diretamente no navegador do usuário. Isso melhora a privacidade, reduz custos de infraestrutura, permite uso offline e abre portas para uma nova gama de experiências interativas e responsivas, tudo com a performance da GPU.

Fontes

Avalie este artigo:
Categoria
CEVIU Web Dev
Publicado
04 de setembro de 2026
Editoria
CEVIU Web Dev

Quer receber mais sobre CEVIU Web Dev?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser