D-Matrix Inova com Raptor para Inferência de IA em 100 TB/s com 3D DRAM
Aprofundamento CEVIU
Aprofundamento
A d-Matrix está impulsionando uma nova arquitetura de hardware com seu acelerador Raptor, direcionado à inferência de IA em grande escala. O cerne da inovação é o empilhamento vertical de um die lógico N4 diretamente sobre 3D DRAM, buscando romper o gargalo de largura de banda que afeta a inferência de Modelos de Linguagem Grandes (LLMs). Enquanto soluções anteriores apostavam em SRAM (alta largura de banda, baixa capacidade) ou HBM (alta capacidade, largura de banda limitada), o Raptor se posiciona como um intermediário poderoso.
Esta abordagem permite uma largura de banda impressionante de 100 TB/s, com ganhos significativos em densidade e eficiência energética, aproximadamente 20 vezes a largura de banda por milímetro quadrado e 13,5 vezes melhor em mW por GB/s comparado ao HBM4. Técnicas como stream blocking, que otimiza o uso do barramento de dados, e a inversão do barramento de dados, que reduz o consumo de energia I/O em 20% sem hardware adicional, são cruciais para alcançar esses números. O objetivo é acelerar a fase de decodificação, que é a mais demorada na inferência de LLMs.
O que mudou
A cobertura anterior do CEVIU News, como em 9 de março de 2026, destacava o papel dos chips com arquitetura SRAM para inferência de IA, focando em baixa latência e alto throughput, mas ressaltando suas limitações de capacidade. A própria d-Matrix havia apresentado o acelerador Corsair em 2025, com foco em computação in-memory baseada em SRAM. O Raptor representa uma evolução clara: a empresa agora aposta no 3D DRAM para conciliar alta largura de banda e capacidade adequada, algo que o SRAM não conseguia entregar em larga escala.
Além disso, enquanto a Samsung anunciou em 5 de agosto de 2026 sua arquitetura zHBM para empilhamento direto de HBM sobre aceleradores, o Raptor da d-Matrix avança com um empilhamento semelhante, mas utilizando 3D DRAM, oferecendo uma alternativa ao HBM para alcançar densidade e largura de banda superiores. Isso mostra uma convergência da indústria para o empilhamento vertical, com diferentes abordagens de memória buscando a melhor solução para os desafios da IA.
Por que isso importa
O crescimento exponencial dos modelos de IA exige soluções que superem rapidamente as limitações de largura de banda e capacidade da memória. O Raptor da d-Matrix, com sua abordagem de 3D DRAM, ataca o ponto nevrálgico da inferência de LLMs: a fase de decodificação, que é intensiva em memória. Ao oferecer 100 TB/s e maior eficiência energética que as soluções HBM atuais, a d-Matrix pode redefinir o projeto de aceleradores de IA.
Se as promessas do Raptor forem comprovadas na prática, isso terá um impacto direto nos data centers, permitindo processamento mais rápido e econômico de modelos de trilhões de parâmetros. Essa inovação cria uma pressão competitiva significativa para gigantes como NVIDIA e AMD, incentivando o desenvolvimento de novas arquiteturas de memória e computação empilhadas para a próxima geração de cargas de trabalho de IA.
Linha do tempo
CEVIU News destaca o papel dos chips SRAM na inferência de IA.
Samsung anuncia memória 3D e empilhamento direto para aceleradores de IA.
Fractile inova com chip de inferência in-memory para LLMs.
d-Matrix lança acelerador Raptor com 3D DRAM para inferência de IA.
Perguntas frequentes
O que é 3D DRAM e qual sua vantagem para a IA?
3D DRAM é uma tecnologia de memória que empilha verticalmente chips de DRAM, permitindo uma conexão mais curta e mais direta com o chip lógico. Para a IA, essa arquitetura oferece largura de banda e densidade significativamente maiores do que as memórias tradicionais, superando gargalos de dados em modelos complexos como os LLMs.
Como o d-Matrix Raptor atinge uma largura de banda de 100 TB/s?
O Raptor combina o empilhamento direto de um die lógico sobre a 3D DRAM com otimizações técnicas. Ele utiliza 'stream blocking' para evitar desperdício de largura de banda e a 'inversão de barramento de dados' para economizar energia I/O, contribuindo para a eficiência e velocidade extraordinárias na transferência de informações.
Que problema o Raptor da d-Matrix busca resolver na inferência de IA?
A d-Matrix busca resolver o gargalo de memória na inferência de LLMs, especialmente na fase de decodificação, que é a mais longa e intensiva em largura de banda. Modelos grandes exigem acesso rápido a enormes volumes de pesos e dados de cache KV. O Raptor oferece alta largura de banda e capacidade equilibrada para lidar com essa demanda de forma eficiente.
Qual a diferença do 3D DRAM do Raptor para HBM e SRAM?
SRAM oferece altíssima largura de banda e baixa latência, mas tem capacidade limitada e alto consumo de energia em escala. HBM (High Bandwidth Memory) oferece boa capacidade e largura de banda decente, mas ainda é limitada em desempenho extremo. O 3D DRAM do Raptor busca um meio-termo, oferecendo largura de banda muito superior ao HBM com capacidade maior que a SRAM, e uma eficiência energética aprimorada.
Fontes
- servethehome.comfonte original
- Categoria
- CEVIU Hardware
- Publicado
- 26 de agosto de 2026
- Editoria
- CEVIU Hardware

