Apache DataFusion 55.0.0 Chega com MERGE INTO e Otimizações de Performance Abrangentes
Aprofundamento CEVIU
Aprofundamento
A versão 55.0.0 do Apache DataFusion traz inovações importantes para quem lida com processamento de dados em escala. A inclusão do comando MERGE INTO, em conformidade com o padrão SQL:2003, facilita operações de upsert e atualizações condicionais, essenciais para gerenciar dados em formatos de lakehouse como Apache Iceberg e Delta Lake. Esta funcionalidade é um passo crucial para a construção de pipelines de dados mais eficientes e confiáveis.
Além disso, o suporte a particionamento por range nativo otimiza a forma como o DataFusion lida com dados naturalmente ordenados, como séries temporais. Isso permite evitar repartitionamentos custosos e aplicar filtros dinâmicos mais específicos nas varreduras. As melhorias de performance são abrangentes, incluindo o pruning TopK, que reduz o tempo de execução de suites de teste em cerca de 43%, e otimizações na leitura de colunas aninhadas em Parquet, que agora evitam leituras desnecessárias de dados não requisitados, impactando diretamente o volume de I/O em cenários como o do DataFusion Comet.
O que mudou
Em comparação com a versão 54.0.0, lançada em 15 de junho de 2026, que introduziu o spill-to-disk para nested loop joins intensivos, o DataFusion 55.0.0 evolui ao oferecer uma abordagem plugável para o spill-to-disk. Agora, implementações personalizadas podem direcionar os dados de spill para diferentes camadas de armazenamento, como o buffer pool do Postgres ou object stores como S3, em vez de depender apenas de arquivos temporários do sistema operacional.
A otimização de consultas em dados quase ordenados, tema de um artigo do CEVIU em 23 de julho de 2026, foi aprimorada. O DataFusion 55.0.0 eleva essa capacidade com limiares de filtro dinâmicos no leitor Parquet e suporte a `ORDER BY` composto, resultando em uma redução significativa no tempo de execução. O que antes era uma utilização da ordem existente, agora é um mecanismo de poda mais inteligente e adaptável, com reavaliação contínua contra grupos de linhas restantes.
Por que isso importa
Estas atualizações são um marco para o ecossistema de dados, especialmente para engenheiros e analistas. O MERGE INTO simplifica a lógica de negócios para sincronização de dados e gerenciamento de estados, enquanto o particionamento por range e as otimizações de performance garantem que o DataFusion continue sendo uma das opções mais rápidas e eficientes para processar volumes massivos de informação. A flexibilidade do spill-to-disk abre portas para integrações mais profundas e controle granular sobre recursos.
Para projetos que utilizam o DataFusion como base, como o DataFusion Comet, cuja versão 1.0.0 foi noticiada em 17 de agosto de 2026 , , essas melhorias significam um desempenho ainda maior e maior compatibilidade com os padrões da indústria. A capacidade de estender o motor de consulta com facilidade solidifica o DataFusion como uma fundação robusta para a próxima geração de sistemas de dados, promovendo a colaboração e a inovação comunitária.
Linha do tempo
Lançamento do Apache DataFusion 54.0.0 com avanços em SQL e spill-to-disk.
Apache DataFusion demonstra capacidade de processar grafos bilionários com eficiência.
Apache Spark 4.2 é lançado com inovações em métricas e SQL.
Apache DataFusion Comet turbina desempenho de queries Spark em tabelas Iceberg.
Apache DataFusion anuncia otimização inovadora para consultas em dados quase ordenados.
Apache DataFusion Comet atinge a versão 1.0.0, acelerando o Spark.
Lançamento do Apache DataFusion 55.0.0 com MERGE INTO e otimizações de performance.
Perguntas frequentes
O que é o Apache DataFusion?
O Apache DataFusion é um motor de consulta extensível, escrito em Rust, que utiliza o Apache Arrow como formato de memória. Ele serve como base para construir novos sistemas de dados rápidos, como bancos de dados, bibliotecas de dataframes e aplicações de machine learning e streaming.
Qual a importância do comando MERGE INTO adicionado ao DataFusion 55.0.0?
O MERGE INTO é um comando SQL padrão (SQL:2003) essencial para operações de upsert e atualizações condicionais. Sua inclusão no DataFusion 55.0.0 o torna um componente fundamental para formatos de tabelas de lakehouse como Apache Iceberg e Delta Lake, simplificando a manipulação de dados em ambientes de big data.
Como as otimizações para colunas aninhadas em Parquet afetam o desempenho?
Em versões anteriores, o DataFusion podia ler e decodificar dados desnecessários de colunas aninhadas, mesmo que a consulta não os requisitasse. A versão 55.0.0 corrige isso, lendo apenas os campos declarados. Esta otimização reduz drasticamente o volume de I/O, melhorando a performance e o uso de recursos, especialmente em cenários como o DataFusion Comet.
Qual a relação entre o DataFusion 55.0.0 e projetos como o DataFusion Comet ou Apache Spark?
O DataFusion é a base para projetos como o DataFusion Comet, que, como noticiamos em 17 de agosto de 2026, acelera o Spark. A versão 55.0.0 traz melhorias que beneficiam diretamente esses ecossistemas, como otimizações de leitura de Parquet baseadas em feedback do Comet e novas APIs para facilitar a construção de sistemas distribuídos, incluindo maior compatibilidade com funções do Spark.
Fontes
- datafusion.apache.orgfonte original
- Categoria
- CEVIU Dados
- Publicado
- 31 de agosto de 2026
- Editoria
- CEVIU Dados

