CEVIU Logo
Voltar
Kimi K3 roda com 952 tokens por segundo em GPUs AMD MI355X, superando Nvidia em custo-benefício

Kimi K3 brilha em GPUs AMD MI355X, superando Nvidia em eficiência

Aprofundamento CEVIU

Aprofundamento

O modelo Kimi K3 da Wafer chega com 2.8 trilhões de parâmetros, exigindo mais de 1.5TB de VRAM. Essa demanda o torna inviável para um único nó de GPUs Nvidia B200, que oferecem 192GB por GPU. A solução encontrada foi a GPU AMD MI355X, que disponibiliza 288GB de VRAM e custa cerca de 2.4 vezes menos que uma Nvidia B300 e 1.7 vezes menos que uma B200. Mesmo com a desvantagem histórica da AMD em suporte de software, a Wafer conseguiu otimizar o Kimi K3 para a MI355X, mostrando que o fosso de software está diminuindo.

O Kimi K3 rodando na MI355X atingiu 952 tokens por segundo por nó. Embora a Nvidia B300 ainda tenha um throughput agregado cerca de 1.65 vezes maior, seu custo elevado faz com que a MI355X ofereça uma performance por dólar superior. As otimizações incluíram o conserto do decodificador especulativo, que resultou em um ganho de 2.2 vezes na performance de fluxo único, e a correção de um kernel de pré-preenchimento, acelerando o time-to-first-token (TTFT) em 2 a 3 vezes. Esses ajustes técnicos foram cruciais para extrair o máximo do hardware da AMD.

O que mudou

A cobertura anterior do CEVIU News, como a de 11 de julho de 2026 sobre o GLM-5.2, já destacava o potencial das GPUs AMD MI355X para inferência de IA, inclusive superando o custo-benefício da Nvidia. Artigos como os de 21 e 29 de julho de 2026 detalhavam a arquitetura inovadora do próprio Kimi K3, com seus 'sparse experts' e 'attention residuals', prometendo eficiência e escalabilidade. Agora, o que vemos é a materialização dessas promessas. Não se trata mais apenas de arquitetura ou rumores de potencial, mas de resultados de benchmark concretos, com o Kimi K3 operando efetivamente na MI355X e demonstrando performance por dólar que desafia o domínio da Nvidia.

As otimizações de software específicas que a Wafer implementou, como a correção do decodificador especulativo e do kernel de pré-preenchimento, transformam o que antes era um desafio conhecido (o ecossistema de software da AMD) em um diferencial. Esses avanços mostram que o suporte ao ROCm, antes visto como um ponto fraco, está amadurecendo rapidamente. Isso move a conversa do “potencial da AMD” para a “realidade da AMD” em um mercado de inferência de IA cada vez mais competitivo.

Por que isso importa

Este resultado é um marco significativo na corrida da IA. Ele valida a AMD como uma alternativa robusta e economicamente viável para a execução de modelos de IA de grande escala, como o Kimi K3, que rivalizam com as soluções de ponta. A disputa por performance por dólar beneficia diretamente o mercado, pois força a inovação e oferece mais opções para empresas e pesquisadores que buscam democratizar o acesso a modelos de IA cada vez mais poderosos.

A evolução do suporte de software para a plataforma ROCm da AMD, que permitiu essas otimizações sem a necessidade de kernels customizados complexos, é um sinal de maturidade. Isso sugere que a "vantagem" da Nvidia em software, embora ainda presente em alguns aspectos, pode não ser mais uma barreira intransponível. A capacidade de rodar modelos "frontier" em hardware AMD com eficiência abre novas portas para o desenvolvimento e implantação de IA open-source.

Linha do tempo

  1. GLM-5.2 e AMD Redefinem Custo-Benefício na Inferência de IA

  2. Mythos Kimi K3: Inovação em Escala com Eficiência Computacional Otimizada

  3. AMD Lidera em Paralelismo de Memória, Superando Intel em Performance

  4. Desempenho excepcional além do escalamento convencional de modelos de IA

  5. Kimi K3: Um Modelo Open-Weight Mais Eficiente e Escalável Com Inovações na Arquitetura

  6. Kimi K3 brilha em GPUs AMD MI355X, superando Nvidia em eficiência

  7. Modelos de IA de código aberto Kimi K3 e MI355X desafiam gigantes da tecnologia

Perguntas frequentes

O que é o Kimi K3 e por que ele é desafiador para operar?

O Kimi K3 é um modelo de IA de código aberto desenvolvido pela Wafer, com 2.8 trilhões de parâmetros. Seu tamanho massivo exige mais de 1.5TB de VRAM, o que dificulta sua execução em GPUs comuns e até mesmo em muitos nós de GPUs de ponta da Nvidia, como o B200, sem configurações complexas de multiprocessamento.

Como a GPU AMD MI355X se posiciona frente à Nvidia neste cenário?

A AMD MI355X se destaca pela sua capacidade de 288GB de VRAM por GPU e um custo significativamente menor em comparação com as GPUs Nvidia B300 e B200. Embora possa ter um throughput agregado ligeiramente menor em algumas cargas, sua performance por dólar é superior, tornando-a uma opção muito atraente para inferência de IA em larga escala.

Quais otimizações de software foram essenciais para o Kimi K3 na MI355X?

A Wafer realizou duas otimizações chave. Primeiro, corrigiu um problema no decodificador especulativo que impedia seu funcionamento adequado no ROCm, resultando em um ganho de 2.2 vezes na performance de fluxo único. Segundo, otimizou o kernel de pré-preenchimento, acelerando o time-to-first-token (TTFT) em 2 a 3 vezes, melhorando a experiência do usuário com o modelo.

O que a performance por dólar significa para o futuro da IA?

A performance por dólar é um indicador crítico que compara a eficiência de um sistema de IA em relação ao seu custo. Quando um hardware oferece uma performance por dólar superior, ele democratiza o acesso a tecnologias de IA avançadas, permitindo que mais empresas e desenvolvedores deployem modelos complexos de forma mais acessível. Isso acelera a inovação e a adoção da IA em diversos setores.

Fontes

Avalie este artigo:
Compartilhar:
Categoria
CEVIU IA
Publicado
03 de agosto de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser