Rodando Modelos de Linguagem no Navegador com Three.js e WebGPU
Aprofundamento CEVIU
Aprofundamento
O projeto Three-LLM está na linha de frente da IA que roda direto no seu navegador. Ele mostra que é possível ter modelos de linguagem como GPT-2, SmolLM2, Qwen e Phi funcionando localmente. A sacada técnica é converter os grafos de inferência desses LLMs em *shaders* de computação TSL, usando o Three.js e a WebGPU. Isso aproveita capacidades da GPU, como *storage buffers* e *compute dispatches*, essenciais para operações pesadas que inferência de modelos exige. É um feito de engenharia: modelos complexos rodam na máquina do usuário sem precisar de um servidor.
O Three-LLM suporta uma gama de arquiteturas, desde o clássico GPT-2 até modelos mais recentes como Llama-style, Gemma 3, Phi e Qwen3.5. Ele carrega configurações e pesos do Hugging Face diretamente, construindo o modelo com *kernels* de computação TSL e executando a inferência na GPU do usuário via WebGPU. Não exige um *runtime* de inferência no servidor ou binários WebAssembly específicos para cada modelo. Isso simplifica bastante a implantação de IA em aplicações web.
O que mudou
A inovação do Three-LLM sinaliza uma mudança na forma como encaramos a execução de LLMs no navegador. Antes, iniciativas como o *preview* do Transformers.js v4, lançado em fevereiro de 2026, já indicavam o caminho com seu *runtime* WebGPU. Mais recentemente, em setembro de 2026, vimos a Hugging Face liberar seus 207 *kernels* WebGPU otimizados. O Three-LLM, porém, adota uma abordagem diferente ao capitalizar sobre as capacidades de *compute* de uma biblioteca gráfica como Three.js. Ele mostra que o ecossistema de inferência *client-side* está se expandindo para além dos *frameworks* de ML dedicados, abraçando ferramentas de outras áreas da computação.
Por que isso importa
Ter LLMs rodando no navegador significa mais privacidade: os dados do usuário não saem da máquina. Também abre portas para aplicações offline e reduz custos de servidor, democratizando o acesso a inteligência artificial avançada. Para devs, é uma oportunidade de criar experiências ricas, com IA responsiva e de baixa latência, sem a complexidade de gerenciar *backends* de inferência. Essa é uma peça chave no que chamamos de "IA de ponta" ou "edge IA", levando o poder do aprendizado de máquina para perto do usuário final.
Linha do tempo
Transformers.js v4 Preview: Já Disponível no NPM!
SEO e IA: Suas Páginas Podem Chamar o LLM Local do Chrome com Uma Linha de JavaScript
O motor de inferência open-source WASTE que democratiza modelos de IA em hardware limitado
Decodificação Especulativa: O Segredo para Acelerar LLMs em até 3 Vezes
Hugging Face impulsiona IA no navegador com 207 kernels WebGPU otimizados
Rodando Modelos de Linguagem no Navegador com Three.js e WebGPU
Perguntas frequentes
O que é Three-LLM e como ele funciona?
Three-LLM é um projeto que permite executar modelos de linguagem como GPT-2 e Phi diretamente no navegador. Ele faz isso convertendo os grafos de inferência dos modelos em *shaders* de computação TSL e usando o *renderer* WebGPU do Three.js para processamento na GPU do usuário.
Quais modelos de linguagem o Three-LLM suporta?
Atualmente, o Three-LLM suporta modelos como GPT-2, SmolLM2, Llama-style, Gemma 3, Phi e Qwen3.5. Ele consegue carregar configurações e pesos do Hugging Face diretamente no navegador, sem a necessidade de conversão prévia ou *runtime* dedicado.
Quais as vantagens de rodar LLMs diretamente no navegador?
As principais vantagens incluem maior privacidade, pois os dados não saem do dispositivo do usuário, a capacidade de operar offline, redução de custos de servidor e latência. Também democratiza o acesso a IA avançada em hardware de consumo, sem depender de infraestrutura na nuvem.
Qual a relação do Three-LLM com WebGPU e Three.js?
O Three-LLM utiliza o Three.js, conhecido por gráficos 3D, mas especificamente seu *renderer* WebGPU. Este *renderer* expõe capacidades de computação da GPU (como *storage buffers* e *compute dispatches*), que são fundamentais para as operações matemáticas intensivas exigidas pelos LLMs.
Fontes
- ben3d.cafonte original
- Categoria
- CEVIU
- Publicado
- 04 de setembro de 2026
- Editoria
- CEVIU

