Voltar
Executando LLMs no navegador com Three.js e WebGPU
🌐CEVIU

Rodando Modelos de Linguagem no Navegador com Three.js e WebGPU

Aprofundamento CEVIU

Aprofundamento

O projeto Three-LLM está na linha de frente da IA que roda direto no seu navegador. Ele mostra que é possível ter modelos de linguagem como GPT-2, SmolLM2, Qwen e Phi funcionando localmente. A sacada técnica é converter os grafos de inferência desses LLMs em *shaders* de computação TSL, usando o Three.js e a WebGPU. Isso aproveita capacidades da GPU, como *storage buffers* e *compute dispatches*, essenciais para operações pesadas que inferência de modelos exige. É um feito de engenharia: modelos complexos rodam na máquina do usuário sem precisar de um servidor.

O Three-LLM suporta uma gama de arquiteturas, desde o clássico GPT-2 até modelos mais recentes como Llama-style, Gemma 3, Phi e Qwen3.5. Ele carrega configurações e pesos do Hugging Face diretamente, construindo o modelo com *kernels* de computação TSL e executando a inferência na GPU do usuário via WebGPU. Não exige um *runtime* de inferência no servidor ou binários WebAssembly específicos para cada modelo. Isso simplifica bastante a implantação de IA em aplicações web.

O que mudou

A inovação do Three-LLM sinaliza uma mudança na forma como encaramos a execução de LLMs no navegador. Antes, iniciativas como o *preview* do Transformers.js v4, lançado em fevereiro de 2026, já indicavam o caminho com seu *runtime* WebGPU. Mais recentemente, em setembro de 2026, vimos a Hugging Face liberar seus 207 *kernels* WebGPU otimizados. O Three-LLM, porém, adota uma abordagem diferente ao capitalizar sobre as capacidades de *compute* de uma biblioteca gráfica como Three.js. Ele mostra que o ecossistema de inferência *client-side* está se expandindo para além dos *frameworks* de ML dedicados, abraçando ferramentas de outras áreas da computação.

Por que isso importa

Ter LLMs rodando no navegador significa mais privacidade: os dados do usuário não saem da máquina. Também abre portas para aplicações offline e reduz custos de servidor, democratizando o acesso a inteligência artificial avançada. Para devs, é uma oportunidade de criar experiências ricas, com IA responsiva e de baixa latência, sem a complexidade de gerenciar *backends* de inferência. Essa é uma peça chave no que chamamos de "IA de ponta" ou "edge IA", levando o poder do aprendizado de máquina para perto do usuário final.

Linha do tempo

  1. Transformers.js v4 Preview: Já Disponível no NPM!

  2. SEO e IA: Suas Páginas Podem Chamar o LLM Local do Chrome com Uma Linha de JavaScript

  3. O motor de inferência open-source WASTE que democratiza modelos de IA em hardware limitado

  4. Decodificação Especulativa: O Segredo para Acelerar LLMs em até 3 Vezes

  5. Hugging Face impulsiona IA no navegador com 207 kernels WebGPU otimizados

  6. Rodando Modelos de Linguagem no Navegador com Three.js e WebGPU

Perguntas frequentes

O que é Three-LLM e como ele funciona?

Three-LLM é um projeto que permite executar modelos de linguagem como GPT-2 e Phi diretamente no navegador. Ele faz isso convertendo os grafos de inferência dos modelos em *shaders* de computação TSL e usando o *renderer* WebGPU do Three.js para processamento na GPU do usuário.

Quais modelos de linguagem o Three-LLM suporta?

Atualmente, o Three-LLM suporta modelos como GPT-2, SmolLM2, Llama-style, Gemma 3, Phi e Qwen3.5. Ele consegue carregar configurações e pesos do Hugging Face diretamente no navegador, sem a necessidade de conversão prévia ou *runtime* dedicado.

Quais as vantagens de rodar LLMs diretamente no navegador?

As principais vantagens incluem maior privacidade, pois os dados não saem do dispositivo do usuário, a capacidade de operar offline, redução de custos de servidor e latência. Também democratiza o acesso a IA avançada em hardware de consumo, sem depender de infraestrutura na nuvem.

Qual a relação do Three-LLM com WebGPU e Three.js?

O Three-LLM utiliza o Three.js, conhecido por gráficos 3D, mas especificamente seu *renderer* WebGPU. Este *renderer* expõe capacidades de computação da GPU (como *storage buffers* e *compute dispatches*), que são fundamentais para as operações matemáticas intensivas exigidas pelos LLMs.

Fontes

Avalie este artigo:
Categoria
CEVIU
Publicado
04 de setembro de 2026
Editoria
CEVIU

Quer receber mais sobre CEVIU?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser