Voltar
D-Matrix integra lógica em 3D DRAM para atingir 100 TB/s de largura de banda em inference

D-Matrix Inova com Raptor para Inferência de IA em 100 TB/s com 3D DRAM

Aprofundamento CEVIU

Aprofundamento

A d-Matrix está impulsionando uma nova arquitetura de hardware com seu acelerador Raptor, direcionado à inferência de IA em grande escala. O cerne da inovação é o empilhamento vertical de um die lógico N4 diretamente sobre 3D DRAM, buscando romper o gargalo de largura de banda que afeta a inferência de Modelos de Linguagem Grandes (LLMs). Enquanto soluções anteriores apostavam em SRAM (alta largura de banda, baixa capacidade) ou HBM (alta capacidade, largura de banda limitada), o Raptor se posiciona como um intermediário poderoso.

Esta abordagem permite uma largura de banda impressionante de 100 TB/s, com ganhos significativos em densidade e eficiência energética, aproximadamente 20 vezes a largura de banda por milímetro quadrado e 13,5 vezes melhor em mW por GB/s comparado ao HBM4. Técnicas como stream blocking, que otimiza o uso do barramento de dados, e a inversão do barramento de dados, que reduz o consumo de energia I/O em 20% sem hardware adicional, são cruciais para alcançar esses números. O objetivo é acelerar a fase de decodificação, que é a mais demorada na inferência de LLMs.

O que mudou

A cobertura anterior do CEVIU News, como em 9 de março de 2026, destacava o papel dos chips com arquitetura SRAM para inferência de IA, focando em baixa latência e alto throughput, mas ressaltando suas limitações de capacidade. A própria d-Matrix havia apresentado o acelerador Corsair em 2025, com foco em computação in-memory baseada em SRAM. O Raptor representa uma evolução clara: a empresa agora aposta no 3D DRAM para conciliar alta largura de banda e capacidade adequada, algo que o SRAM não conseguia entregar em larga escala.

Além disso, enquanto a Samsung anunciou em 5 de agosto de 2026 sua arquitetura zHBM para empilhamento direto de HBM sobre aceleradores, o Raptor da d-Matrix avança com um empilhamento semelhante, mas utilizando 3D DRAM, oferecendo uma alternativa ao HBM para alcançar densidade e largura de banda superiores. Isso mostra uma convergência da indústria para o empilhamento vertical, com diferentes abordagens de memória buscando a melhor solução para os desafios da IA.

Por que isso importa

O crescimento exponencial dos modelos de IA exige soluções que superem rapidamente as limitações de largura de banda e capacidade da memória. O Raptor da d-Matrix, com sua abordagem de 3D DRAM, ataca o ponto nevrálgico da inferência de LLMs: a fase de decodificação, que é intensiva em memória. Ao oferecer 100 TB/s e maior eficiência energética que as soluções HBM atuais, a d-Matrix pode redefinir o projeto de aceleradores de IA.

Se as promessas do Raptor forem comprovadas na prática, isso terá um impacto direto nos data centers, permitindo processamento mais rápido e econômico de modelos de trilhões de parâmetros. Essa inovação cria uma pressão competitiva significativa para gigantes como NVIDIA e AMD, incentivando o desenvolvimento de novas arquiteturas de memória e computação empilhadas para a próxima geração de cargas de trabalho de IA.

Linha do tempo

  1. CEVIU News destaca o papel dos chips SRAM na inferência de IA.

  2. Samsung anuncia memória 3D e empilhamento direto para aceleradores de IA.

  3. Fractile inova com chip de inferência in-memory para LLMs.

  4. d-Matrix lança acelerador Raptor com 3D DRAM para inferência de IA.

Perguntas frequentes

O que é 3D DRAM e qual sua vantagem para a IA?

3D DRAM é uma tecnologia de memória que empilha verticalmente chips de DRAM, permitindo uma conexão mais curta e mais direta com o chip lógico. Para a IA, essa arquitetura oferece largura de banda e densidade significativamente maiores do que as memórias tradicionais, superando gargalos de dados em modelos complexos como os LLMs.

Como o d-Matrix Raptor atinge uma largura de banda de 100 TB/s?

O Raptor combina o empilhamento direto de um die lógico sobre a 3D DRAM com otimizações técnicas. Ele utiliza 'stream blocking' para evitar desperdício de largura de banda e a 'inversão de barramento de dados' para economizar energia I/O, contribuindo para a eficiência e velocidade extraordinárias na transferência de informações.

Que problema o Raptor da d-Matrix busca resolver na inferência de IA?

A d-Matrix busca resolver o gargalo de memória na inferência de LLMs, especialmente na fase de decodificação, que é a mais longa e intensiva em largura de banda. Modelos grandes exigem acesso rápido a enormes volumes de pesos e dados de cache KV. O Raptor oferece alta largura de banda e capacidade equilibrada para lidar com essa demanda de forma eficiente.

Qual a diferença do 3D DRAM do Raptor para HBM e SRAM?

SRAM oferece altíssima largura de banda e baixa latência, mas tem capacidade limitada e alto consumo de energia em escala. HBM (High Bandwidth Memory) oferece boa capacidade e largura de banda decente, mas ainda é limitada em desempenho extremo. O 3D DRAM do Raptor busca um meio-termo, oferecendo largura de banda muito superior ao HBM com capacidade maior que a SRAM, e uma eficiência energética aprimorada.

Fontes

Avalie este artigo:
Categoria
CEVIU Hardware
Publicado
26 de agosto de 2026
Editoria
CEVIU Hardware

Quer receber mais sobre CEVIU Hardware?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser