Apache DataFusion Comet Chega à Versão 1.0.0 e Acelera o Spark
Aprofundamento CEVIU
Aprofundamento
O Apache DataFusion Comet, agora na versão 1.0.0, é um acelerador fundamental para o Apache Spark, projetado para otimizar a execução de jobs sem exigir mudanças no código. Ele traduz planos físicos do Spark para planos físicos do DataFusion, explorando a eficiência da computação nativa em Rust. Esta versão consolida o suporte para Spark 4.0 e superiores, incluindo o modo ANSI por padrão, e estende a cobertura de operadores para operações como joins, funções de janela, geradores e scans de tabela em memória. Um destaque é a validação rigorosa da correção, que usa os próprios testes do Spark (mais de 24.000 testes unitários), testes Scala de ponta a ponta, fuzz testing e até auditorias com IA generativa para garantir paridade com os resultados do Spark.
A arquitetura do Comet se beneficia do codegen dispatch, um mecanismo que preenche lacunas de expressão. Se o Comet não tem uma implementação nativa para uma expressão, ele invoca o código gerado pelo Spark para aquela parte específica, mantendo o restante da pipeline no Comet. Isso minimiza o custo de conversão de dados entre os ecossistemas. A versão 1.0.0 expande esse recurso, roteando mais tipos de expressões e casts através do dispatcher, e oferece suporte experimental para UDFs (User-Defined Functions) PyArrow aceleradas. A compatibilidade com o Iceberg Table Format V3, incluindo a criptografia de tabela completa, e a otimização de diversos kernels para operações numéricas, de string e data, reforçam a capacidade do Comet de processar dados complexos com alta performance.
O que mudou
Desde sua primeira versão, 0.1.0, lançada em agosto de 2024, após ser doado ao Apache DataFusion em março de 2024, o Comet passou de um “ganho modesto de velocidade” para apresentar “ganhos significativos” em benchmarks independentes, como os da AWS Labs. A cobertura CEVIU de 20 de julho de 2026 já destacava o Apache DataFusion Comet turbinando o desempenho de queries Spark em tabelas Iceberg; a versão 1.0.0 aprofunda isso com suporte explícito ao Iceberg Table Format V3, incluindo criptografia e novas capacidades de scan.
Em termos de arquitetura, o codegen dispatch evoluiu significativamente. Em versões anteriores, expressões sem implementação nativa podiam fazer com que subárvores inteiras do plano de execução voltassem ao Spark. Na versão 0.17.0, a otimização focou em devolver apenas a expressão. Agora, no Comet 1.0.0, ambas as estratégias de suporte (nativas ou via fallback) são roteadas pelo dispatcher, e casts complexos também utilizam esse caminho, otimizando ainda mais a execução. Outra mudança importante, seguindo a política de versionamento semântico da 1.0.0, é a depreciação do JDK 11 e do Spark 3.4, com remoção planejada para a versão 1.1.0, alinhando o Comet com as versões mais recentes do Spark e do ecossistema Java.
Por que isso importa
A chegada do Apache DataFusion Comet 1.0.0 é um marco para a engenharia de dados. Ele oferece uma forma eficaz de turbinar pipelines de dados no Spark sem a complexidade de reescrever aplicações. Isso significa que equipes podem obter ganhos de performance substanciais em jobs de processamento e análise, reduzindo custos de infraestrutura e acelerando a entrega de resultados.
A garantia de compatibilidade com Spark 4.0+ e o suporte a padrões de mercado como o Iceberg V3 garantem que a solução esteja alinhada com as inovações mais recentes. A validação rigorosa da correção, inclusive com auditorias de IA, proporciona confiança nos resultados. Em resumo, o Comet 1.0.0 é uma ferramenta valiosa para qualquer equipe que busca otimizar a infraestrutura de dados e extrair mais valor de seus investimentos em Spark.
Linha do tempo
Comet é doado ao projeto Apache DataFusion.
Lançamento do Comet 0.1.0, sua primeira versão.
Apache DataFusion 54.0.0 é lançado com avanços em SQL e desempenho.
Apache Spark 4.2 é lançado, com governança de métricas e IA.
CEVIU News publica sobre Apache DataFusion Comet turbinando queries Spark em tabelas Iceberg.
CEVIU News publica sobre inovações do Apache Spark 4.2 em métricas, SQL e geoespacial.
CEVIU News publica sobre otimização para consultas em dados quase ordenados no Apache DataFusion.
Apache DataFusion Comet Chega à Versão 1.0.0 e Acelera o Spark.
Perguntas frequentes
O que é o Apache DataFusion Comet e qual seu propósito?
O Apache DataFusion Comet é um acelerador para o Apache Spark. Ele otimiza a performance de jobs Spark convertendo seus planos físicos em planos do DataFusion, que são executados nativamente em Rust. O propósito é oferecer ganhos de velocidade significativos sem exigir alterações no código existente do Spark.
Quais as principais novidades da versão 1.0.0 do Comet?
A versão 1.0.0 traz versionamento semântico, suporte completo ao Spark 4.0+ (incluindo modo ANSI), cobertura expandida de operadores e expressões, e aprimoramentos no mecanismo de codegen dispatch. Também inclui suporte experimental a UDFs PyArrow e compatibilidade com o Iceberg Table Format V3.
É preciso reescrever o código Spark para usar o Comet 1.0.0?
Não, uma das grandes vantagens do Comet é acelerar os jobs Spark sem a necessidade de reescrever códigos. Ele se integra ao ecossistema existente, permitindo que as equipes obtenham melhorias de performance de forma transparente, apenas habilitando o acelerador.
Como o Comet garante a correção dos resultados ao acelerar o Spark?
O Comet passa por testes rigorosos. Ele executa a própria suíte de testes do Spark (mais de 24.000 testes), além de testes Scala de ponta a ponta, fuzz testing com dados aleatórios e até auditorias com IA generativa para garantir que os resultados sejam idênticos aos produzidos pelo Spark.
Fontes
- datafusion.apache.orgfonte original
- Categoria
- CEVIU Dados
- Publicado
- 17 de agosto de 2026
- Editoria
- CEVIU Dados
