CEVIU Logo
Voltar
Cloudflare otimiza execução de modelos de IA como Kimi e GLM em escala

Cloudflare aprimora execução de modelos de IA com otimizações em escala na plataforma Workers AI

Aprofundamento CEVIU

Aprofundamento

A otimização da execução de modelos de IA, como o Kimi K2.6 da Moonshot e o GLM da Z.ai, na plataforma Workers AI da Cloudflare, é um avanço crucial em engenharia de plataformas. A Cloudflare adotou três técnicas principais para gerenciar as demandas de memória e processamento. Primeiramente, a quantização do cache KV, antes em 16 bits, agora usa ponto flutuante de 8 bits (FP8). Isso dobra a capacidade de contexto do Kimi K2.6 para 1,37 milhão de tokens, reduzindo o custo por token em 30%.

Em segundo lugar, a compactação dos pesos do modelo GLM, passando de inteiros de 8 bits para 4 bits (INT4), diminuiu o tamanho do checkpoint de 705 GB para 421 GB. Essa técnica acelera a decodificação de requisições únicas em 55%. Por fim, uma camada de verificação de integridade do cache KV foi implementada para garantir a segurança dos dados entre usuários em ambientes multi-tenant, adicionando menos de 1% de overhead. A Cloudflare utiliza SGLang como framework de inferência, garantindo alta performance e eficiência.

O que mudou

Essa otimização demonstra uma evolução notável na capacidade da Cloudflare de hospedar modelos de IA de ponta em sua infraestrutura. Em 20 de março de 2026, o CEVIU News noticiou a introdução do Kimi K2.5 na Workers AI, destacando sua janela de contexto de 256k tokens e economia de custos. Agora, com o Kimi K2.6, a Cloudflare não apenas suporta uma versão mais recente do modelo, mas também expandiu sua janela de contexto para impressionantes 1,37 milhão de tokens, uma melhoria de mais de cinco vezes na capacidade de memória do cache KV. Isso prova que as promessas de economia e escala da plataforma estão se concretizando com engenharia avançada.

Por que isso importa

Para o ecossistema DevOps e engenharia de plataformas, essas otimizações são fundamentais. Elas permitem que desenvolvedores utilizem modelos de IA mais poderosos com janelas de contexto estendidas a um custo significativamente menor, sem comprometer a acurácia. A capacidade de otimizar a utilização de recursos de GPU, como memória e largura de banda, através de técnicas como quantização e compressão de pesos, é vital para a sustentabilidade e escalabilidade de aplicações de IA. A verificação de integridade do cache, por sua vez, adiciona uma camada essencial de confiabilidade e segurança em um ambiente de hardware compartilhado, garantindo a integridade dos dados mesmo com alto volume de requisições.

Linha do tempo

  1. Cloudflare Workers IA passa a suportar o modelo Kimi K2.5 da Moonshot AI, com 256k tokens de contexto.

  2. Cloudflare anuncia otimizações para Workers AI, dobrando o contexto do Kimi K2.6 para 1,37 milhão de tokens e acelerando o GLM.

Perguntas frequentes

O que é a quantização do cache KV na Workers AI da Cloudflare?

A quantização do cache KV é uma técnica onde a Cloudflare armazena o cache de atenção em ponto flutuante de 8 bits (FP8) em vez de 16 bits (BF16). Isso reduz o uso de memória pela metade, permitindo que modelos como o Kimi K2.6 suportem mais tokens de contexto simultaneamente. A mudança dobra a capacidade de contexto e diminui o custo por token.

Como a Cloudflare otimiza os pesos do modelo GLM?

A Cloudflare compacta os pesos do modelo GLM, convertendo-os de inteiros de 8 bits para inteiros de 4 bits (INT4). Essa compressão reduz o tamanho do checkpoint do modelo em cerca de 40%, liberando memória da GPU. Como resultado, a velocidade de decodificação de requisições únicas aumenta em 55%.

Qual a importância da verificação de integridade do cache KV?

A verificação de integridade do cache KV garante que múltiplas requisições, que compartilham a mesma memória da GPU, não acessem dados incorretos ou conflitantes. Esta camada de segurança protege a integridade dos dados entre usuários, adicionando menos de 1% de sobrecarga no throughput e latência, tornando o ambiente mais seguro e confiável.

Como as otimizações afetam a acurácia dos modelos de IA?

A Cloudflare enfatiza que todas essas otimizações, tanto a quantização do cache KV quanto a compressão dos pesos do modelo, foram implementadas sem qualquer perda perceptível na acurácia dos modelos. Testes extensivos confirmaram que a qualidade das respostas permanece inalterada, combinando eficiência com alta performance.

Fontes

Avalie este artigo:
Compartilhar:
Categoria
CEVIU DevOps
Publicado
05 de agosto de 2026
Editoria
CEVIU DevOps

Quer receber mais sobre CEVIU DevOps?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser