Apache Fluss 1.0 Chega para Fortalecer Fundações de Dados em Tempo Real para IA
Aprofundamento CEVIU
Aprofundamento
O Apache Fluss 1.0 estabelece uma fundação robusta para a gestão de dados em tempo real, especificamente desenhada para atender às necessidades urgentes de aplicações de IA. A grande novidade é a introdução de um Gateway HTTP stateless em Rust. Este componente é leve e de alta performance, permitindo que agentes de IA, serviços web e automação acessem metadados, gerenciem tabelas e realizem escritas em lote através de requisições HTTP comuns. Ele dispensa a JVM e pode ser escalado de forma independente, oferecendo um ponto de entrada flexível para diferentes pilhas tecnológicas.
A gestão do ciclo de vida dos dados ganhou melhorias significativas. O Fluss 1.0 implementa Time-to-Live (TTL) em nível de linha e para logs locais, complementando as políticas de retenção de partição existentes. Isso permite um controle granular sobre a vida útil dos dados. Outro ponto forte é o Predicate Pushdown, que otimiza leituras ao descartar blocos de dados irrelevantes no armazenamento, usando estatísticas de coluna. A capacidade de escalar buckets para partições futuras e as varreduras do lado do servidor para tabelas de chave primária interativas também aprimoram a performance e a escalabilidade. Há também um acesso nativo mais amplo com clientes em Rust, Python, C++ e Java, com um núcleo Rust compartilhado que agiliza o desenvolvimento e a consistência entre linguagens.
O que mudou
A versão 1.0 do Apache Fluss aprofunda sua integração com o ecossistema de processamento de dados, como o Spark. Enquanto o CEVIU News noticiou os lançamentos do Spark 4.1.0 em 31 de agosto de 2026 e do Spark 4.2 em 17 e 20 de julho de 2026, que trouxeram pipelines declarativos, otimizações de streaming e avanços em IA, o Fluss agora oferece um suporte aprimorado para estas ferramentas. Ele inclui Union Read em lote e leituras incrementais por janelas de tempo, permitindo que o Spark consuma dados do Fluss de maneira mais eficiente e alinhada com suas capacidades de streaming e IA. Essas integrações fortalecem a interoperabilidade e o fluxo de dados entre as plataformas.
Por que isso importa
O Apache Fluss 1.0 é um passo crucial para quem lida com aplicações de IA que exigem dados em tempo real. A capacidade de fornecer informações frescas, como perfis de usuário ou interações recentes, é fundamental para inferência e treinamento de modelos. A arquitetura do Fluss, com seu gateway HTTP em Rust e acesso nativo em Python, simplifica a integração para desenvolvedores de IA, removendo barreiras técnicas. As funcionalidades de gestão do ciclo de vida dos dados e otimização de leitura garantem que as operações de dados sejam eficientes e escaláveis. Isso tudo consolida o Fluss como um componente essencial na construção de lakehouses robustos para IA, tornando as aplicações mais ágeis e inteligentes.
Linha do tempo
Apache Spark 4.2 Chega com Governança de Métricas e Avanços em IA
Apache Spark 4.2 Chega com Inovações em Métricas, SQL e Recursos Geoespaciais
Spark 4.1.0 Desembarca com Pipelines Declarativos e Otimizações de Streaming
Apache DataFusion 55.0.0 Chega com MERGE INTO e Otimizações de Performance Abrangentes
Databricks Lança Reparticionamento de Estado Sob Demanda para Apache Spark Structured Streaming
PyIceberg 0.12.0: Novidades Robustas para Manipulação de Dados
Apache Fluss 1.0 Chega para Fortalecer Fundações de Dados em Tempo Real para IA
Perguntas frequentes
O que é o Apache Fluss 1.0 e por que ele é importante para IA?
O Apache Fluss 1.0 é um sistema de fundação de dados em tempo real que gerencia metadados, operações de tabela e escritas em lote. Ele é crucial para IA porque fornece dados frescos e históricos de forma eficiente, essenciais para treinamento e inferência de modelos, permitindo que as aplicações de IA se mantenham atualizadas com o mundo real.
Qual a principal vantagem do novo Gateway HTTP no Fluss 1.0?
O novo Gateway HTTP, escrito em Rust, oferece acesso leve e de alta performance ao Fluss. Ele permite que agentes e aplicações de IA interajam com os dados via HTTP sem a necessidade de SDKs nativos ou da JVM, simplificando a integração e deployment, além de ser stateless e escalável.
Como o Fluss 1.0 aprimora a gestão do ciclo de vida dos dados?
A versão 1.0 introduz Time-to-Live (TTL) em nível de linha e para logs locais, permitindo políticas de retenção de dados mais flexíveis. Além disso, o Predicate Pushdown otimiza a leitura ao descartar dados desnecessários no armazenamento, e o escalonamento de buckets ajusta a capacidade de partição conforme a carga de trabalho evolui.
Quais são as melhorias na integração com outras plataformas de dados?
O Fluss 1.0 melhora a integração com plataformas como Flink, Spark, Hudi e Paimon. Ele suporta acesso nativo em Python, Union Read e leituras incrementais para Spark, e expande o Lakestream para Hudi, além de permitir acesso a partições históricas para o Paimon, facilitando o uso de dados em tempo real e históricos em um lakehouse.
Fontes
- fluss.apache.orgfonte original
- Categoria
- CEVIU Dados
- Publicado
- 24 de setembro de 2026
- Editoria
- CEVIU Dados

