Voltar
Datadog estende Apache DataFusion para execução distribuída de queries

Datadog inova com extensão distribuída para Apache DataFusion

Aprofundamento CEVIU

Aprofundamento

A Datadog, ao introduzir o Distributed DataFusion, resolve um desafio crítico na escalabilidade de motores de consulta interativos. Anteriormente, o Apache DataFusion, embora sendo um motor de consulta extensível e combinável, operava com uma limitação fundamental: processava todas as consultas em uma única máquina. Essa arquitetura se tornava um gargalo para cargas de trabalho de dados massivas, comuns em ambientes como o da Datadog, que gerencia métricas, rastreamentos, logs e sinais de segurança.

O Distributed DataFusion estende essa capacidade, permitindo que o DataFusion execute consultas complexas em um cluster de máquinas. O projeto é open-source, escrito em Rust, e se integra com os padrões Apache Arrow para formato de dados em memória e Substrait para planos de execução. Essa abordagem visa oferecer a escalabilidade de um sistema distribuído sem sacrificar a baixa latência crucial para consultas interativas, um ponto que diferencia a solução de motores que dependem de materialização intermediária de dados, como o Spark, conforme o próprio artigo da Datadog aponta. A Datadog já vinha alinhando sua arquitetura a padrões abertos, conforme o CEVIU noticiou em 31 de agosto de 2026, com o lançamento do DataFusion 55.0.0, e em 6 de agosto de 2026, com a integração do DuckLake, reforçando o foco em um ecossistema combinável.

O que mudou

A evolução aqui é notável na superação das limitações do Apache DataFusion para grandes volumes de dados. O DataFusion, embora robusto em seu core, era restrito à execução em uma única máquina, o que gerava a necessidade de sistemas de consulta especializados para diferentes cargas. Com o Distributed DataFusion, essa fragmentação é atacada, unificando a execução para cargas leves e pesadas sob o mesmo motor.

Outro ponto de contraste importante está na abordagem da Datadog em relação a outras soluções distribuídas. Enquanto projetos como o Apache Spark e o Ballista do DataFusion confiam na materialização de dados intermediários, o que introduz latência, o Distributed DataFusion foi desenhado para evitar isso. Essa escolha ressoa com a filosofia por trás do Apache DataFusion Comet, que também busca acelerar o Spark evitando a materialização, conforme noticiado pelo CEVIU em 17 de agosto de 2026. A Datadog, ao invés de adotar uma solução existente, optou por construir um framework extensível que se adequa perfeitamente aos seus requisitos de baixa latência e integração com Arrow e Substrait.

Por que isso importa

Essa inovação da Datadog é um divisor de águas para a engenharia de dados, especialmente para quem trabalha com processamento analítico interativo em larga escala. Ao tornar o DataFusion distribuído e open-source, a Datadog não só aprimora sua própria infraestrutura, mas também oferece uma ferramenta poderosa para a comunidade. Equipes agora podem construir seus motores de consulta personalizados que rodam eficientemente em clusters, sem precisar lidar com a complexidade de criar uma solução distribuída do zero ou se adaptar a motores que não atendem requisitos de baixa latência.

A capacidade de acelerar consultas pesadas em até 10 vezes sem aumentar os custos, enquanto preserva a eficiência para consultas leves, significa otimização de recursos e melhor experiência para o usuário final. Isso simplifica a arquitetura de dados, promovendo um sistema unificado e mais flexível, capaz de lidar com a crescente demanda por insights rápidos e complexos.

Linha do tempo

  1. Apache DataFusion 54.0.0 chega com avanços em SQL, desempenho e suporte a dados aninhados

  2. Apache Spark 4.2 Chega com Inovações em Métricas, SQL e Recursos Geoespaciais

  3. DuckLake Aprimora Apache DataFusion com Gerenciamento de Metadados Transacionais

  4. Apache DataFusion Comet Chega à Versão 1.0.0 e Acelera o Spark

  5. Apache DataFusion 55.0.0 Chega com MERGE INTO e Otimizações de Performance Abrangentes

  6. Datadog inova na execução de código para otimização de IA no servidor MCP

  7. Datadog inova com extensão distribuída para Apache DataFusion

Perguntas frequentes

O que é o Distributed DataFusion?

É uma extensão open-source desenvolvida pela Datadog para o Apache DataFusion, que permite que ele execute consultas complexas em múltiplas máquinas. Seu objetivo é escalar o poder de processamento para cargas de trabalho de dados massivas, mantendo baixa latência para consultas interativas.

Por que a Datadog desenvolveu essa extensão em vez de usar motores de consulta distribuídos existentes?

A Datadog precisava de um framework altamente extensível para integrar suas fontes de dados e otimizações, que oferecesse baixa latência para consultas interativas sem materialização intermediária, e que fosse eficiente em escala. Soluções existentes como Spark ou ClickHouse não atendiam a todos esses requisitos simultaneamente.

Como o Distributed DataFusion acelera as consultas?

Ele estende o modelo de particionamento do DataFusion para trabalhar em um cluster de máquinas, processando dados em paralelo. Para consultas pesadas, ele distribui a carga, enquanto para consultas leves, ele evita a sobrecarga de distribuição, executando-as em uma única máquina, otimizando o uso de recursos.

O Distributed DataFusion é open-source?

Sim, a Datadog disponibilizou o Distributed DataFusion como um framework open-source em Rust, sob licença Apache 2.0. Isso permite que outras equipes e empresas o adaptem para suas próprias infraestruturas e fontes de dados, fomentando a inovação na comunidade de engenharia de dados.

Fontes

Avalie este artigo:
Categoria
CEVIU Dados
Publicado
05 de outubro de 2026
Editoria
CEVIU Dados

Quer receber mais sobre CEVIU Dados?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser