Datadog inova com extensão distribuída para Apache DataFusion
Aprofundamento CEVIU
Aprofundamento
A Datadog, ao introduzir o Distributed DataFusion, resolve um desafio crítico na escalabilidade de motores de consulta interativos. Anteriormente, o Apache DataFusion, embora sendo um motor de consulta extensível e combinável, operava com uma limitação fundamental: processava todas as consultas em uma única máquina. Essa arquitetura se tornava um gargalo para cargas de trabalho de dados massivas, comuns em ambientes como o da Datadog, que gerencia métricas, rastreamentos, logs e sinais de segurança.
O Distributed DataFusion estende essa capacidade, permitindo que o DataFusion execute consultas complexas em um cluster de máquinas. O projeto é open-source, escrito em Rust, e se integra com os padrões Apache Arrow para formato de dados em memória e Substrait para planos de execução. Essa abordagem visa oferecer a escalabilidade de um sistema distribuído sem sacrificar a baixa latência crucial para consultas interativas, um ponto que diferencia a solução de motores que dependem de materialização intermediária de dados, como o Spark, conforme o próprio artigo da Datadog aponta. A Datadog já vinha alinhando sua arquitetura a padrões abertos, conforme o CEVIU noticiou em 31 de agosto de 2026, com o lançamento do DataFusion 55.0.0, e em 6 de agosto de 2026, com a integração do DuckLake, reforçando o foco em um ecossistema combinável.
O que mudou
A evolução aqui é notável na superação das limitações do Apache DataFusion para grandes volumes de dados. O DataFusion, embora robusto em seu core, era restrito à execução em uma única máquina, o que gerava a necessidade de sistemas de consulta especializados para diferentes cargas. Com o Distributed DataFusion, essa fragmentação é atacada, unificando a execução para cargas leves e pesadas sob o mesmo motor.
Outro ponto de contraste importante está na abordagem da Datadog em relação a outras soluções distribuídas. Enquanto projetos como o Apache Spark e o Ballista do DataFusion confiam na materialização de dados intermediários, o que introduz latência, o Distributed DataFusion foi desenhado para evitar isso. Essa escolha ressoa com a filosofia por trás do Apache DataFusion Comet, que também busca acelerar o Spark evitando a materialização, conforme noticiado pelo CEVIU em 17 de agosto de 2026. A Datadog, ao invés de adotar uma solução existente, optou por construir um framework extensível que se adequa perfeitamente aos seus requisitos de baixa latência e integração com Arrow e Substrait.
Por que isso importa
Essa inovação da Datadog é um divisor de águas para a engenharia de dados, especialmente para quem trabalha com processamento analítico interativo em larga escala. Ao tornar o DataFusion distribuído e open-source, a Datadog não só aprimora sua própria infraestrutura, mas também oferece uma ferramenta poderosa para a comunidade. Equipes agora podem construir seus motores de consulta personalizados que rodam eficientemente em clusters, sem precisar lidar com a complexidade de criar uma solução distribuída do zero ou se adaptar a motores que não atendem requisitos de baixa latência.
A capacidade de acelerar consultas pesadas em até 10 vezes sem aumentar os custos, enquanto preserva a eficiência para consultas leves, significa otimização de recursos e melhor experiência para o usuário final. Isso simplifica a arquitetura de dados, promovendo um sistema unificado e mais flexível, capaz de lidar com a crescente demanda por insights rápidos e complexos.
Linha do tempo
Apache DataFusion 54.0.0 chega com avanços em SQL, desempenho e suporte a dados aninhados
Apache Spark 4.2 Chega com Inovações em Métricas, SQL e Recursos Geoespaciais
DuckLake Aprimora Apache DataFusion com Gerenciamento de Metadados Transacionais
Apache DataFusion Comet Chega à Versão 1.0.0 e Acelera o Spark
Apache DataFusion 55.0.0 Chega com MERGE INTO e Otimizações de Performance Abrangentes
Datadog inova na execução de código para otimização de IA no servidor MCP
Datadog inova com extensão distribuída para Apache DataFusion
Perguntas frequentes
O que é o Distributed DataFusion?
É uma extensão open-source desenvolvida pela Datadog para o Apache DataFusion, que permite que ele execute consultas complexas em múltiplas máquinas. Seu objetivo é escalar o poder de processamento para cargas de trabalho de dados massivas, mantendo baixa latência para consultas interativas.
Por que a Datadog desenvolveu essa extensão em vez de usar motores de consulta distribuídos existentes?
A Datadog precisava de um framework altamente extensível para integrar suas fontes de dados e otimizações, que oferecesse baixa latência para consultas interativas sem materialização intermediária, e que fosse eficiente em escala. Soluções existentes como Spark ou ClickHouse não atendiam a todos esses requisitos simultaneamente.
Como o Distributed DataFusion acelera as consultas?
Ele estende o modelo de particionamento do DataFusion para trabalhar em um cluster de máquinas, processando dados em paralelo. Para consultas pesadas, ele distribui a carga, enquanto para consultas leves, ele evita a sobrecarga de distribuição, executando-as em uma única máquina, otimizando o uso de recursos.
O Distributed DataFusion é open-source?
Sim, a Datadog disponibilizou o Distributed DataFusion como um framework open-source em Rust, sob licença Apache 2.0. Isso permite que outras equipes e empresas o adaptem para suas próprias infraestruturas e fontes de dados, fomentando a inovação na comunidade de engenharia de dados.
Fontes
- datadoghq.comfonte original
- Categoria
- CEVIU Dados
- Publicado
- 05 de outubro de 2026
- Editoria
- CEVIU Dados

