Voltar
Por dentro do megakernel de inferência para o North Mini Code

Cohere revela megakernel de inferência para o North Mini Code, superando vLLM em desempenho

Aprofundamento CEVIU

Aprofundamento

A Cohere atacou um dos grandes gargalos da inferência de Large Language Models (LLMs): a ineficiência de hardware na decodificação. Enquanto a maioria dos servidores trata cada passagem de decodificação como uma sequência de kernels de GPU separados (QKV, atenção, MoE, etc.), com pausas custosas entre eles, a Cohere inovou com um sistema de inferência completo centrado em um megakernel de decodificação para seu modelo North Mini Code. Este megakernel essencialmente funde diversas operações em um único kernel persistente, eliminando o tempo de espera e aproveitando melhor a largura de banda da memória HBM, um fator crucial para a performance em inferência.

A arquitetura detalhada pela Cohere não é apenas um conceito, mas uma implementação robusta que integra continuous batching, paged attention e suporte a sequências de comprimento variável. Mais do que isso, o sistema é acessível via um endpoint compatível com OpenAI e inclui capacidade de tool calling, facilitando a integração em aplicações existentes. Os resultados impressionam: 292 tokens por segundo com batch size de 1, atingindo 62% do Speed-of-Light (SoL) e superando o vLLM em 1,58 vezes, mantendo a precisão e a vantagem em diversos cenários, inclusive com contextos de até 256K. Isso mostra um salto na forma como a inferência de LLMs é executada em GPUs.

Por que isso importa

A otimização na inferência de LLMs é fundamental para reduzir os custos operacionais e expandir o acesso a modelos de IA mais poderosos. Ao superar as limitações de throughput impostas por arquiteturas de inferência tradicionais, a abordagem de megakernels da Cohere não apenas torna modelos como o North Mini Code mais rápidos, mas também mais econômicos para serem implantados em escala. Isso permite que empresas e desenvolvedores utilizem IA avançada de forma mais eficiente, acelerando a inovação e a criação de novas aplicações que antes seriam inviáveis devido ao custo computacional.

Linha do tempo

  1. DFlash e Spec V2 revolucionam a speculative decoding, aumentando o throughput de LLMs.

  2. DFlash 2 aprimora a decodificação especulativa, acelerando inferência de LLMs em até três vezes.

  3. Cohere lança o Parse, um modelo de IA focado em processamento documental corporativo.

  4. GLM-5.3 emerge como otimização revolucionária na inferência de LLMs, reduzindo custos.

  5. Inception Labs lança Mercury 2.5, com avanços em desempenho e inteligência para LLMs.

  6. Cohere revela megakernel de inferência para o North Mini Code, superando o vLLM em desempenho.

Perguntas frequentes

O que são megakernels na inferência de IA?

Megakernels são kernels de GPU que consolidam múltiplas operações de uma passagem de decodificação de LLM em um único bloco persistente. Eles reduzem a sobrecarga de lançamento de kernels individuais, minimizando o tempo de espera entre operações e otimizando o uso da largura de banda da memória da GPU.

Como o megakernel da Cohere melhora o desempenho do North Mini Code?

O megakernel da Cohere otimiza o desempenho ao integrar funcionalidades como continuous batching e paged attention, operando como um único kernel que minimiza os tempos de espera entre operações. Isso resulta em uma taxa de transferência de tokens significativamente maior e uso mais eficiente da largura de banda da memória HBM, superando soluções existentes como o vLLM e alcançando 62% do Speed-of-Light.

Qual a importância de otimizar a inferência de LLMs para a indústria?

Modelos de linguagem grandes consomem muitos recursos computacionais. A otimização da inferência, como a implementada pela Cohere, reduz custos operacionais e a latência, permitindo que mais usuários acessem a IA avançada. Isso acelera a implantação de LLMs em diversas aplicações, democratizando seu uso e impulsionando a inovação em IA.

O que é o North Mini Code e por que ele se beneficia tanto do megakernel?

O North Mini Code é um modelo da Cohere de 30 bilhões de parâmetros, com aproximadamente 3,3 bilhões ativos por token durante a inferência. Ele se beneficia imensamente dos megakernels porque a inferência de LLMs grandes é limitada pela largura de banda da memória (HBM). A arquitetura do megakernel otimiza o fluxo de dados do HBM, melhorando drasticamente a velocidade de decodificação para este tipo de modelo.

Fontes

Avalie este artigo:
Categoria
CEVIU IA
Publicado
09 de setembro de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser