Three-LLM Viabiliza LLMs no Navegador com WebGPU e Three.js
Aprofundamento CEVIU
Aprofundamento
O projeto Three-LLM representa um avanço significativo na execução de Large Language Models (LLMs) diretamente no navegador, explorando a capacidade de computação geral da WebGPU via Three.js. A iniciativa transforma grafos de inferência de LLMs, como GPT-2, SmolLM2, Qwen e Phi, em compute shaders TSL (Three.js Shading Language) para WebGPU. Isso elimina a dependência de um runtime de inferência server-side, carregando configurações, tokenizers e SafeTensors diretamente do Hugging Face. A arquitetura de um LLM, da tokenização à amostragem, é mapeada para sequências de kernels TSL, que incluem operações como multiplicação matriz-vetor (TSLLinear), normalização (TSLNormalize, TSLRMSNorm), atenção (TSLAttention) e MLPs (TSLMLP, TSLGatedMLP).
As otimizações são cruciais para a performance. Por exemplo, a submissão de um único comando para o forward pass de um LLM, que anteriormente exigia mais de 400 submissões separadas, impulsionou a decodificação de TinyStories de 120 para 566 tokens por segundo. Outras melhorias incluem evitar o cálculo de logits de vocabulário desnecessários durante o prefill e a redução da amostragem (sampling) na GPU, que move a lógica de seleção de tokens para o hardware gráfico, minimizando o gargalo de leitura de dados para o JavaScript. Diferentes arquiteturas de LLMs são suportadas através de recipes flexíveis, adaptando-se a características como Rotary Position Embeddings (RoPE), Grouped-Query Attention e Gated DeltaNet, que usam estado recorrente para gerenciar memória.
O que mudou
A execução de LLMs no navegador não é uma novidade absoluta. O CEVIU News já cobriu, em fevereiro de 2026, a prévia do Transformers.js v4 com um novo WebGPU Runtime. Mais recentemente, em setembro de 2026, noticiamos que a Hugging Face liberou 207 kernels WebGPU otimizados. O Three-LLM, porém, mostra uma evolução na integração e na abordagem. Enquanto as coberturas anteriores focavam em runtimes gerais ou bibliotecas de kernels, o Three-LLM demonstra como uma biblioteca de renderização 3D como o Three.js pode ser estendida para se tornar uma plataforma de computação generalista para IA, traduzindo grafos de inferência de modelos diretamente em shaders.
A principal mudança está na tangibilidade de rodar modelos complexos como Qwen e Phi diretamente no navegador, de ponta a ponta, sem a necessidade de conversão offline ou runtimes específicos de modelo. Isso representa um passo adiante na concretização da IA verdadeiramente client-side, utilizando a infraestrutura da WebGPU de uma maneira inovadora e altamente performática, algo que as discussões sobre “executar modelos locais” (junho de 2026) apontavam como futuro, e que agora o Three-LLM entrega de forma pragmática para o ambiente web.
Por que isso importa
A execução de LLMs diretamente no navegador tem implicações profundas para desenvolvedores e para o futuro das aplicações web. Primeiro, promove a privacidade e a segurança, mantendo os dados do usuário localmente. Segundo, reduz significativamente os custos de infraestrutura, eliminando a necessidade de servidores de inferência dedicados para muitas aplicações. Terceiro, abre caminho para experiências de usuário mais fluidas e responsivas, com latência mínima e funcionalidade offline.
Para a comunidade de desenvolvimento, é um catalisador para a criação de novas categorias de aplicações web, desde ferramentas de produtividade com IA integrada até jogos e experiências interativas que podem gerar conteúdo em tempo real usando modelos de linguagem. Também demonstra o crescente poder da WebGPU e da computação paralela no navegador, incentivando a exploração de bibliotecas como Three.js para além de suas funções tradicionais de renderização.
Linha do tempo
Transformers.js v4 Preview: Já Disponível no NPM! (WebGPU Runtime)
Executar modelos locais virou realidade prática para devs
FreeToken Otimiza Modelos MoE em Dispositivos Pessoais
DFlash 2 revoluciona inferência de LLMs com decodificação especulativa aprimorada
Decodificação Especulativa: O Segredo para Acelerar LLMs em até 3 Vezes
Hugging Face impulsiona IA no navegador com 207 kernels WebGPU otimizados
Three-LLM Viabiliza LLMs no Navegador com WebGPU e Three.js
Perguntas frequentes
O que é o Three-LLM?
Three-LLM é um projeto inovador que permite rodar Large Language Models (LLMs) como GPT-2 e Qwen diretamente no navegador. Ele faz isso traduzindo os grafos de inferência dos modelos em compute shaders TSL, executados via WebGPU e Three.js, eliminando a necessidade de um servidor de inferência.
Quais modelos de LLM são compatíveis com o Three-LLM?
O Three-LLM é compatível com diversos modelos de LLM, incluindo GPT-2, SmolLM2, Qwen e Phi. Ele carrega as configurações, tokenizers e SafeTensors desses modelos diretamente do Hugging Face, suportando diferentes arquiteturas como as de estilo Llama e Qwen3.5.
Como o Three-LLM alcança alta performance no navegador?
A alta performance do Three-LLM se deve a otimizações como a submissão de um único comando para o forward pass dos modelos, que reduz a sobrecarga da CPU. Ele também evita o cálculo de logits desnecessários e realiza a amostragem (sampling) na GPU, liberando a CPU e aproveitando ao máximo a capacidade de computação paralela da WebGPU.
Qual o principal benefício do Three-LLM para desenvolvedores?
Para desenvolvedores, o principal benefício é a capacidade de criar aplicações web com funcionalidades de IA avançadas, rodando diretamente no navegador do usuário. Isso melhora a privacidade, reduz custos de infraestrutura, permite uso offline e abre portas para uma nova gama de experiências interativas e responsivas, tudo com a performance da GPU.
Fontes
- ben3d.cafonte original
- Categoria
- CEVIU Web Dev
- Publicado
- 04 de setembro de 2026
- Editoria
- CEVIU Web Dev

