Voltar
DataFusion ClickBench performance on c7a.metal-48xlarge

Apache DataFusion 55.0.0 Chega com MERGE INTO e Otimizações de Performance Abrangentes

Aprofundamento CEVIU

Aprofundamento

A versão 55.0.0 do Apache DataFusion traz inovações importantes para quem lida com processamento de dados em escala. A inclusão do comando MERGE INTO, em conformidade com o padrão SQL:2003, facilita operações de upsert e atualizações condicionais, essenciais para gerenciar dados em formatos de lakehouse como Apache Iceberg e Delta Lake. Esta funcionalidade é um passo crucial para a construção de pipelines de dados mais eficientes e confiáveis.

Além disso, o suporte a particionamento por range nativo otimiza a forma como o DataFusion lida com dados naturalmente ordenados, como séries temporais. Isso permite evitar repartitionamentos custosos e aplicar filtros dinâmicos mais específicos nas varreduras. As melhorias de performance são abrangentes, incluindo o pruning TopK, que reduz o tempo de execução de suites de teste em cerca de 43%, e otimizações na leitura de colunas aninhadas em Parquet, que agora evitam leituras desnecessárias de dados não requisitados, impactando diretamente o volume de I/O em cenários como o do DataFusion Comet.

O que mudou

Em comparação com a versão 54.0.0, lançada em 15 de junho de 2026, que introduziu o spill-to-disk para nested loop joins intensivos, o DataFusion 55.0.0 evolui ao oferecer uma abordagem plugável para o spill-to-disk. Agora, implementações personalizadas podem direcionar os dados de spill para diferentes camadas de armazenamento, como o buffer pool do Postgres ou object stores como S3, em vez de depender apenas de arquivos temporários do sistema operacional.

A otimização de consultas em dados quase ordenados, tema de um artigo do CEVIU em 23 de julho de 2026, foi aprimorada. O DataFusion 55.0.0 eleva essa capacidade com limiares de filtro dinâmicos no leitor Parquet e suporte a `ORDER BY` composto, resultando em uma redução significativa no tempo de execução. O que antes era uma utilização da ordem existente, agora é um mecanismo de poda mais inteligente e adaptável, com reavaliação contínua contra grupos de linhas restantes.

Por que isso importa

Estas atualizações são um marco para o ecossistema de dados, especialmente para engenheiros e analistas. O MERGE INTO simplifica a lógica de negócios para sincronização de dados e gerenciamento de estados, enquanto o particionamento por range e as otimizações de performance garantem que o DataFusion continue sendo uma das opções mais rápidas e eficientes para processar volumes massivos de informação. A flexibilidade do spill-to-disk abre portas para integrações mais profundas e controle granular sobre recursos.

Para projetos que utilizam o DataFusion como base, como o DataFusion Comet, cuja versão 1.0.0 foi noticiada em 17 de agosto de 2026 , , essas melhorias significam um desempenho ainda maior e maior compatibilidade com os padrões da indústria. A capacidade de estender o motor de consulta com facilidade solidifica o DataFusion como uma fundação robusta para a próxima geração de sistemas de dados, promovendo a colaboração e a inovação comunitária.

Linha do tempo

  1. Lançamento do Apache DataFusion 54.0.0 com avanços em SQL e spill-to-disk.

  2. Apache DataFusion demonstra capacidade de processar grafos bilionários com eficiência.

  3. Apache Spark 4.2 é lançado com inovações em métricas e SQL.

  4. Apache DataFusion Comet turbina desempenho de queries Spark em tabelas Iceberg.

  5. Apache DataFusion anuncia otimização inovadora para consultas em dados quase ordenados.

  6. Apache DataFusion Comet atinge a versão 1.0.0, acelerando o Spark.

  7. Lançamento do Apache DataFusion 55.0.0 com MERGE INTO e otimizações de performance.

Perguntas frequentes

O que é o Apache DataFusion?

O Apache DataFusion é um motor de consulta extensível, escrito em Rust, que utiliza o Apache Arrow como formato de memória. Ele serve como base para construir novos sistemas de dados rápidos, como bancos de dados, bibliotecas de dataframes e aplicações de machine learning e streaming.

Qual a importância do comando MERGE INTO adicionado ao DataFusion 55.0.0?

O MERGE INTO é um comando SQL padrão (SQL:2003) essencial para operações de upsert e atualizações condicionais. Sua inclusão no DataFusion 55.0.0 o torna um componente fundamental para formatos de tabelas de lakehouse como Apache Iceberg e Delta Lake, simplificando a manipulação de dados em ambientes de big data.

Como as otimizações para colunas aninhadas em Parquet afetam o desempenho?

Em versões anteriores, o DataFusion podia ler e decodificar dados desnecessários de colunas aninhadas, mesmo que a consulta não os requisitasse. A versão 55.0.0 corrige isso, lendo apenas os campos declarados. Esta otimização reduz drasticamente o volume de I/O, melhorando a performance e o uso de recursos, especialmente em cenários como o DataFusion Comet.

Qual a relação entre o DataFusion 55.0.0 e projetos como o DataFusion Comet ou Apache Spark?

O DataFusion é a base para projetos como o DataFusion Comet, que, como noticiamos em 17 de agosto de 2026, acelera o Spark. A versão 55.0.0 traz melhorias que beneficiam diretamente esses ecossistemas, como otimizações de leitura de Parquet baseadas em feedback do Comet e novas APIs para facilitar a construção de sistemas distribuídos, incluindo maior compatibilidade com funções do Spark.

Fontes

Avalie este artigo:
Categoria
CEVIU Dados
Publicado
31 de agosto de 2026
Editoria
CEVIU Dados

Quer receber mais sobre CEVIU Dados?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser