CEVIU Logo
Voltar
Motor de inference open source WASTE permite rodar modelos grandes em hardwares com menos memória

O motor de inferência open-source WASTE que democratiza modelos de IA em hardware limitado

Aprofundamento CEVIU

Aprofundamento

O motor de inferência WASTE surge como um avanço fundamental na democratização de modelos de IA de grande porte. Sua premissa é executar modelos cujos pesos excedem a memória disponível na máquina hospedeira, como um Kimi K3 de 2.78 trilhões de parâmetros rodando em um MacBook Pro com apenas 64 GB de memória unificada. Para isso, o WASTE explora a arquitetura Mixture-of-Experts (MoE) do Kimi K3. Ele mantém o 'tronco' do modelo (parte comum e menor) residente na RAM, enquanto os pesados módulos de 'experts' são armazenados no NVMe e carregados sob demanda.

Este engenho, escrito em C e sem dependências externas para inferência, gerencia o cache de experts diretamente, bypassando o cache do sistema operacional para otimizar o acesso a dados de 17 GB por token. A performance atual do Kimi K3 é de 0.3 tokens por segundo, que não serve para aplicações interativas, mas prova a viabilidade técnica. Modelos menores, como o Kimi-Linear 48B, já rodam a 8.9 tokens por segundo na mesma máquina, mostrando a flexibilidade da abordagem. O WASTE funciona em macOS, Linux e Windows, com suporte para CPU ARM e x86, além de oferecer uma API C embarcável e um servidor HTTP compatível com OpenAI.

O que mudou

A cobertura anterior do CEVIU News sobre a viabilidade de IA local, como no artigo de 16 de junho de 2026, que falava em modelos como Gemma rodando em hardware pessoal, agora ganha um novo patamar. O WASTE eleva essa conversa ao permitir que modelos na escala do Kimi K3, com trilhões de parâmetros, sejam executados em laptops. Isso demonstra uma evolução do que era considerado 'hardware pessoal' capaz de hospedar IA.

Em 29 de julho de 2026, o CEVIU News detalhava o Kimi K3 e suas inovações arquitetônicas, como o LatentMoE. Agora, o WASTE mostra como essa arquitetura, antes uma promessa de eficiência e escala, pode ser explorada para superar limites de hardware. Ou seja, o potencial do Kimi K3, antes teórico, se torna executável. Também em 24 de julho de 2026, mencionávamos a ascensão dos modelos open-weight e sua crescente paridade com soluções de ponta. O WASTE materializa essa visão, fornecendo uma ferramenta para o desenvolvimento local desses modelos gigantes, sem a necessidade de infraestrutura massiva na nuvem.

A iniciativa do WASTE ecoa o espírito do Devin Outposts, da Cognition AI, que em 22 de julho de 2026 prometia levar a IA dev para qualquer plataforma. Enquanto Devin focava em um agente de IA específico, o WASTE expande essa democratização para modelos de linguagem grandes e genéricos. Ele permite a desenvolvedores com hardware modesto experimentarem e construírem diretamente sobre os avanços mais recentes em IA, sem a dependência de serviços remotos.

Por que isso importa

O motor WASTE representa uma virada importante na relação entre IA avançada e hardware acessível. Ele oferece um caminho para democratizar o acesso a modelos de IA de grande porte, liberando desenvolvedores e organizações da dependência de infraestruturas de nuvem caras. Isso significa controle maior sobre custos, privacidade de dados e flexibilidade na implantação.

Ao viabilizar a execução local, o WASTE permite que a inovação em IA ocorra em um espectro muito mais amplo de ambientes, desde o laptop de um desenvolvedor até infraestruturas corporativas com recursos limitados. A capacidade de operar IA de ponta offline ou em ambientes restritos aprimora a segurança e a disponibilidade. Este movimento favorece um ecossistema de IA mais distribuído, resistente e inovador, onde a experimentação e o desenvolvimento não estão mais limitados pela capacidade de investir em supercomputadores.

Linha do tempo

  1. CEVIU News reporta: Executar modelos locais virou realidade prática para devs

  2. CEVIU News reporta: IA de Pequeno Porte Impulsiona Inovação em Setores Críticos Globalmente

  3. CEVIU News reporta: Devin Outposts: A IA Dev Agora Roda em Qualquer Lugar

  4. CEVIU News reporta: A Ascensão dos Modelos Open-Weight e o Futuro da Inovação em Startups

  5. Pesos do modelo Kimi K3 são liberados

  6. CEVIU News reporta: Kimi K3, um Modelo Open-Weight com Inovações na Arquitetura

  7. CEVIU News reporta: Nova Geração de Modelos Multimodais Leves Desafia Gigantes da IA

  8. Lançamento do WASTE, motor de inferência open-source para modelos grandes em hardware limitado

Perguntas frequentes

O que é o motor de inferência WASTE?

WASTE (Weight-Aware Streaming Tensor Engine) é um motor de inferência open-source projetado para executar modelos de IA com pesos maiores que a memória RAM disponível. Ele permite que modelos complexos, como o Kimi K3 com 2.78 trilhões de parâmetros, rodem em máquinas com recursos limitados, como um MacBook Pro de 64 GB.

Como o WASTE consegue rodar modelos tão grandes em hardware limitado?

O WASTE explora a arquitetura Mixture-of-Experts (MoE) dos modelos. Ele mantém a parte essencial ('trunk') na memória RAM, enquanto os módulos especializados ('experts') são armazenados no disco NVMe. Estes experts são carregados sob demanda quando necessários, otimizando o uso da memória e superando o gargalo da RAM.

Qual a performance atual do WASTE e quais são suas vantagens?

A performance inicial para o Kimi K3 é de 0.3 tokens por segundo, ainda lenta para interatividade, mas prova a viabilidade. Modelos menores como o Kimi-Linear 48B já alcançam 8.9 tokens por segundo. As principais vantagens incluem maior controle sobre custos de infraestrutura, melhor privacidade de dados, operação offline e autonomia na implantação dos modelos.

Quais plataformas o WASTE suporta?

O motor WASTE é escrito em C, sem dependências de inferência externas. Ele oferece uma API C embarcável, um servidor HTTP compatível com OpenAI e possui implementações para CPUs ARM e x86. Suporta os sistemas operacionais macOS, Linux e Windows, permitindo ampla flexibilidade para desenvolvedores.

Fontes

Avalie este artigo:
Compartilhar:
Categoria
CEVIU IA
Publicado
31 de julho de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser