Apache DataFusion Comet 1.1.0: Mais Performance e Estabilidade com Iceberg e Celeborn
Aprofundamento CEVIU
Aprofundamento
A versão 1.1.0 do Apache DataFusion Comet aprofunda a capacidade do acelerador de Spark, trazendo novidades significativas para o ecossistema de dados. O Comet otimiza a performance do Spark traduzindo planos físicos para DataFusion, sem exigir mudanças no código. Esta atualização de sete semanas, com 398 commits de 40 contribuidores, tem como pilar a expansão da execução nativa.
Um dos destaques é a introdução de gravações nativas experimentais para o Apache Iceberg, usando iceberg-rust. Antes, o Comet acelerava apenas leituras. Agora, ele divide o operador de escrita do Spark, permitindo que o iceberg-rust cuide da escrita de arquivos Parquet, enquanto o iceberg-java finaliza o commit. Isso visa maior performance e eficiência, especialmente porque o Apache Iceberg 1.12.0, lançado em 6 de outubro de 2026, já trouxe otimizações robustas.
Outro ponto crítico é a gestão de memória. Usuários do Comet frequentemente enfrentavam a interrupção de executors devido à pressão de memória off-heap. A versão 1.1.0 melhora a contabilidade e o registro dessa memória não rastreada, fornecendo visibilidade e corrigindo falhas de contagem de pools. O Comet agora rastreia cada byte alocado e loga o uso de memória nativa a cada 10 segundos, ajudando a dimensionar corretamente o spark.executor.memoryOverhead e a evitar encerramentos inesperados de containers. Há também a integração nativa com Apache Celeborn para shuffle, onde tasks map empurram dados Arrow diretamente e reducers os leem nativamente. Embora a compatibilidade total com clientes Celeborn 0.6.x e 0.7.x ainda esteja em desenvolvimento, a base está lançada para ganhos de performance no shuffle distribuído.
O que mudou
Comparado à versão 1.0.0 do Comet, lançada em 17 de agosto de 2026, a 1.1.0 marca uma evolução importante. Na cobertura do CEVIU de 20 de julho de 2026, destacamos como o Comet turbinava apenas o desempenho de leituras de queries Spark em tabelas Iceberg. Agora, com a 1.1.0, o acelerador avança para suportar experimentalmente as gravações nativas do Iceberg, completando o ciclo de dados e oferecendo um processamento mais coeso.
Além disso, enquanto a versão 1.0.0 já suportava o Spark 4 (e o Spark 4.1.0 foi lançado em 31 de agosto de 2026), a 1.1.0 foca em refinar a execução nativa. A integração com Celeborn para shuffle nativo também é uma novidade que, na versão anterior, simplesmente recorria ao shuffle padrão do Spark. As melhorias na gestão de memória são uma resposta direta a um problema recorrente, transformando uma fonte de instabilidade em um pilar de robustez operacional para o Comet.
Por que isso importa
Para engenheiros de dados e analistas, o Apache DataFusion Comet 1.1.0 representa um passo significativo em direção a pipelines de dados mais eficientes e estáveis. A capacidade de realizar gravações nativas em Apache Iceberg, mesmo que experimental, elimina um gargalo potencial e permite uma utilização mais completa da infraestrutura otimizada do Comet, do Iceberg e do Spark. Isso acelera não só a leitura, mas agora também a persistência de dados em formatos abertos.
As melhorias na gestão de memória abordam diretamente um ponto crítico de falha, reduzindo a imprevisibilidade de workloads e a necessidade de intervenções manuais. A integração com Celeborn aprimora o desempenho de operações de shuffle, essenciais para o processamento distribuído em larga escala. Em suma, esta versão oferece mais controle, desempenho e confiabilidade, ferramentas cruciais para quem trabalha com processamento massivo de dados.
Linha do tempo
Apache DataFusion 54.0.0 chega com avanços em SQL, desempenho e suporte a dados aninhados
Apache DataFusion Comet turbina desempenho de queries Spark em tabelas Iceberg
Apache DataFusion Comet Chega à Versão 1.0.0 e Acelera o Spark
Apache DataFusion 55.0.0 Chega com MERGE INTO e Otimizações de Performance Abrangentes
Spark 4.1.0 Desembarca com Pipelines Declarativos e Otimizações de Streaming
Apache Iceberg 1.12.0: Desempenho e Inovação para Dados em Escala
Apache DataFusion Comet 1.1.0: Mais Performance e Estabilidade com Iceberg e Celeborn
Perguntas frequentes
O que é Apache DataFusion Comet?
O Apache DataFusion Comet é um acelerador de performance para o Apache Spark. Ele converte planos físicos do Spark em planos do DataFusion, permitindo a execução de operações de forma mais otimizada e nativa, sem a necessidade de reescrever código.
Qual a principal novidade do Comet 1.1.0 em relação ao Apache Iceberg?
A principal novidade é a introdução de gravações nativas experimentais para tabelas Apache Iceberg. Anteriormente, o Comet focava em acelerar apenas as leituras; agora, ele permite que a escrita de dados seja feita de forma nativa, utilizando a biblioteca iceberg-rust.
Como as melhorias de memória afetam o uso do Comet?
As melhorias de memória abordam a pressão da memória off-heap, um problema comum que levava à falha de executors. O Comet agora rastreia e loga melhor o uso de memória nativa, corrigindo falhas de contabilidade e permitindo que os usuários configurem o Spark de forma mais precisa, aumentando a estabilidade operacional.
O que muda com a integração nativa do Celeborn?
A integração com Apache Celeborn permite que as operações de shuffle, que movem dados entre as etapas de processamento, sejam realizadas de forma nativa pelo Comet. Isso pode resultar em ganhos significativos de desempenho para workloads distribuídas, embora a compatibilidade plena com as versões atuais do cliente Celeborn ainda esteja em fase de aprimoramento.
Fontes
- datafusion.apache.orgfonte original
- Categoria
- CEVIU Dados
- Publicado
- 08 de outubro de 2026
- Editoria
- CEVIU Dados
