CEVIU Dados
Todas as notícias

CEVIU Dados

Big data, ciência de dados e engenharia de dados

691 notícias

CEVIU Dados🚀 Lançamento

A extensão Iceberg do DuckDB agora eleva o nível, permitindo operações CTAS, MERGE INTO, INSERT, UPDATE e DELETE. Isso o estabelece como uma ferramenta robusta para ETL no estilo CRUD (Create, Read, Update, Delete) diretamente em ambientes locais, eliminando a dependência do Apache Spark. Em conjunto com o MinIO para armazenamento compatível com S3 e o LakeKeeper, um catálogo Iceberg baseado em Rust, equipes de engenharia de dados podem prototipar e testar pipelines de forma econômica via Docker, garantindo uma transição fluida para tabelas AWS S3 apenas ajustando variáveis de ambiente e segredos.

CEVIU Dados🚀 Lançamento

O Apache DataFusion agora implementa uma otimização significativa para o processamento de dados quase ordenados, impactando diretamente operações como `ORDER BY` e `ORDER BY ... LIMIT N`. A ferramenta passa a utilizar automaticamente a ordenação exata e parcial dos dados, empregando estatísticas de min/max do formato Parquet, estratégias de reordenação de arquivos e filtros dinâmicos. Essa abordagem evita varreduras completas e bloqueios de ordenação, resultando em um ganho notável de eficiência para o processamento analítico e de dados em larga escala.

No universo do Apache Spark, a recomputação de Common Table Expressions (CTEs) aninhadas e reutilizadas é um desafio de performance padrão. Para contornar isso, a estratégia ideal é o cache seletivo em pontos de "fan-out", especialmente quando os resultados intermediários são complexos, manejáveis em memória e sujeitos a reutilização frequente. É crucial evitar o cache de conjuntos de dados excessivamente grandes ou triviais, que poderiam sobrecarregar o sistema. A implementação do cache "eager" facilita o monitoramento e materializa cadeias de transformação profundas, prevenindo recomputações desnecessárias e otimizando a utilização de recursos.

Benchmarks de Text-to-SQL frequentemente superestimam o desempenho real, pois não conseguem replicar a complexidade inerente e a desorganização dos data warehouses modernos. A discrepância entre o ambiente controlado dos testes e a realidade dos dados corporativos, marcados por estruturas heterogêneas e falta de padronização, levanta sérias questões sobre a aplicabilidade prática e a confiabilidade dessas ferramentas em cenários de produção. Entender essa lacuna é crucial para o desenvolvimento de soluções mais robustas e realistas no campo da análise de dados.

Uma nova solução de análise de impacto de deriva de esquema para lakehouses surge, utilizando Iceberg e Lakekeeper para transformar alterações de schema em alertas e recomendações quase em tempo real. O processo se inicia com engines de consulta emitindo comandos DDL, que o Lakekeeper prontamente utiliza para atualizar o catálogo Iceberg e disparar eventos de mudança para Kafka/Redpanda. Em questão de segundos, um serviço baseado em FastAPI, aiokafka e Anthropic (IA) analisa o impacto, eliminando a necessidade de varredura de metadados. Os resultados são então entregues via Slack e persistidos em SQLite, agilizando a governança de dados.

A escolha do esquema de banco de dados representa um vetor crítico para a dívida técnica, com decisões de design que, uma vez implementadas, são de difícil reversão e podem acarretar custos operacionais e de manutenção por anos. Aspectos como a definição de chaves primárias, estratégias de particionamento e a escolha de tipos de coluna exigem rigorosos guardrails e validação pré-produção. Ignorar tais precauções transforma o banco de dados em um passivo irreversível, comprometendo a escalabilidade e a performance da infraestrutura de dados.

CEVIU Dados🚀 Lançamento

O Aurora DSQL surge como uma solução inovadora para sistemas OLTP (Online Transaction Processing) multi-região, operando em modo ativo-ativo e oferecendo compatibilidade plena com PostgreSQL, além de consistência forte. A plataforma simplifica a gestão de infraestrutura ao eliminar a necessidade de gerenciar servidores, shards, réplicas e failover. Embora a latência cross-region seja compensada no commit, equipes de dados devem atentar para a execução de transações curtas e considerar limitações atuais, como o limite de 3.000 linhas ou 10 MiB por transação e a ausência de chaves estrangeiras impostas.

Sistemas de produção estão adotando equipes de agentes especializados – como triagem, SQL e Python – e a plataforma MCP surge como integradora, conectando-os a ferramentas como GitHub, Slack e PostgreSQL. Grafos de memória persistente permitem que esses agentes acumulem conhecimento organizacional entre chamadas, otimizando fluxos de trabalho. Contudo, a interação entre múltiplos agentes introduz riscos de 'prompt injection' lateral, o que impulsiona a mitigação com proveniência criptográfica de tooling e o uso de sandboxes efêmeros para garantir a segurança e integridade dos dados e operações.

CEVIU Dados🚀 Lançamento

O Apache Spark 4.2 acaba de ser lançado, apresentando uma série de melhorias que reforçam sua posição como ferramenta central no processamento de dados. Entre as novidades, destacam-se as "metric views" para a definição de métricas de negócio, a busca de similaridade via SQL vector e a introdução de tipos geoespaciais nativos. A versão também incorpora queries de Change Data Capture (CDC) através da nova cláusula CHANGES, otimizando a sincronização de dados. A facilidade de uso foi aprimorada com o Spark Connect e a execução padrão otimizada com Arrow para Python. Com mais de 1.900 commits de 260 contribuidores, o Spark 4.2 promete maior eficiência e flexibilidade para o ecossistema de dados.

A recente aquisição da Dremio pela SAP sinaliza um desafio crescente para plataformas de dados que operam exclusivamente com o modelo lakehouse. A integração, em vez da substituição, da tecnologia da Dremio no SAP Datasphere sugere que as demandas da IA – que incluem amplo alcance de dados, frescor em tempo real e capacidade de consultas imprevisíveis – podem superar a capacidade de arquiteturas puramente lakehouse. Isso indica uma tendência em direção a abordagens mais híbridas e integradas para atender às necessidades complexas da análise e do aprendizado de máquina impulsionados pela IA.

A Airbnb implementou uma estratégia inovadora para acelerar a avaliação de Grandes Modelos de Linguagem (LLMs), condensando ciclos que antes levavam semanas para menos de um dia. A metodologia se apoia no caching inteligente de referências e pontuações de julgadores, otimizando o processo ao identificar que mais da metade das saídas de modelos candidatos são strings idênticas, com uma variação mínima de 1% no desempenho do julgador. Para ajustes rápidos, adaptadores LoRA de baixo rank são treinados em menos de uma hora utilizando uma única GPU, permitindo correções no mesmo dia. O processo é finalizado com uma etapa de validação em tráfego amostrado, assegurando a identificação de possíveis falhas em tempo real.

A Trellis introduz os "experience graphs" como uma inovadora arquitetura de dados para o armazenamento persistente de artefatos de agentes, recompensas, dados de busca e histórico causal. Acessíveis via SQL, grafos, vetores e consultas temporais, essa abordagem permite que agentes de IA se autoaprimorem de forma eficiente. Pesquisas da Meta demonstraram que a reutilização de experiências anteriores acelera o desempenho em até 10 vezes e reduz os custos de token em 52% para soluções bem-sucedidas. Contudo, um reuso excessivo de memória pode impactar negativamente a capacidade de exploração dos agentes.

CEVIU Dados🔮 Rumor

A Databricks, empresa que se consolidou no mercado de dados, está prestes a levantar US$3 bilhões, o que catapultaria seu valor de mercado para a impressionante cifra de US$188 bilhões. Este movimento estratégico reflete a bem-sucedida transição da companhia de uma plataforma de dados robusta para um dos principais fornecedores de soluções de IA para o setor corporativo, consolidando sua posição no cenário tecnológico global.

O vindouro Postgres 19 trará uma importante otimização na gestão de armazenamento, substituindo a compressão padrão de objetos TOAST do algoritmo pglz para o LZ4. Esta mudança, que será integrada ao framework unificado de compressão, abrange não apenas o armazenamento em heap, mas também TOAST e índices B-tree. Tipos de dados de comprimento variável como TEXT, VARCHAR, BYTEA e JSONB, que superam o limite de aproximadamente 2 KB, serão automaticamente beneficiados. Testes preliminares apontam que o LZ4 oferece desempenho superior ao pglz, garantindo compressão mais eficiente e detecção rápida de dados incompressíveis, resultando em maior eficiência e menor latência para operações de banco de dados.

A Netflix implementou uma plataforma unificada para operar seus serviços de LLMs internamente, evitando APIs externas. A arquitetura, baseada em JVM com gRPC e uma API HTTP compatível com OpenAI, padroniza a implantação via Model Scoring Service. Este serviço é suportado pelo Triton e utiliza o vLLM como motor principal, após rigorosos testes de benchmark. A solução ainda inclui empacotamento customizado, atualizações sem interrupção e decodificação guiada, com patches específicos para garantir a correta geração de saídas JSON, otimizando performance e controle da IA.

Para agentes de IA empresariais, a busca por vetores e o Retrieval Augmented Generation (RAG) não são suficientes. Embora o RAG consiga identificar passagens relevantes, ele não garante a preservação de limites de origem, o significado de negócio, a propriedade ou as restrições de uso dos dados. A solução proposta foca na construção de um modelo de produto de dados governado, compilado em diversas representações, como grafos, wikis Markdown, pacotes OKF e sidecars compactos (TOON/GCF). Isso demonstra que a preparação para a IA não se resume a um catálogo, mas sim a um contexto conectado, confiável e a operações repetíveis, garantindo que a IA opere com dados estruturados e bem definidos.

O Apache DataFusion Comet eleva o desempenho de leitura do Spark em tabelas Iceberg, combinando o planejamento de queries em Java com a execução nativa Arrow via Iceberg Rust. Testes de benchmark TPC-DS de 3 TB demonstraram um salto significativo: 102 de 103 queries aceleradas e uma redução de aproximadamente 40% no tempo total de execução. Adicionalmente, a interoperabilidade com os pacotes de testes Spark do Iceberg Java foi crucial, impulsionando mais de 40 pull requests que aprimoraram o Iceberg Rust.

A Meta está aprimorando a otimização de seu funil de anúncios por meio de uma abordagem inovadora: a compressão de bilhões de usuários e entidades em clusters de interesses latentes. Estes são enriquecidos com conteúdo de anúncios processado por Large Language Models (LLMs), incorporando tudo em um espaço compartilhado para pontuar qualquer usuário ou entidade. Ao aprender com a estrutura ampla do grafo, e não apenas com eventos de conversão raros, a Meta obtém um sinal robusto para o funil profundo, alimentando modelos de ranking de anúncios como GEM e Andromeda. Essa estratégia promete maior precisão e relevância em suas campanhas.

No recente evento VB Transform 2026, empresas como LinkedIn, Walmart e Zendesk compartilharam suas abordagens inovadoras para superar os desafios da infraestrutura legada frente à velocidade dos agentes de IA. O LinkedIn destacou a importância de pré-provisionar containers e a transição de 80% da orquestração para código determinístico. Já o Walmart focou na governança de agentes internos duplicados, enquanto a Zendesk aprimorou seus pipelines de dados para processar um volume massivo de 20 bilhões de conversas. As lições aprendidas apontam para a necessidade de avaliações contínuas, controle sobre o 'agent harness' e a portabilidade das cargas de trabalho entre diferentes modelos.

Um estudo recente comparou o desempenho do Polars em configuração distribuída (32 nós) contra um nó único m8i.32xlarge, ambos com especificações agregadas similares (128 vCPUs, 512GB RAM) em um benchmark TPC-H de 1TB. Os resultados mostraram que o Polars distribuído teve uma leve vantagem em queries intensivas em I/O, aproveitando uma largura de banda de rede de 400 Gbps, superior aos 50 Gbps sustentados do nó único. Contudo, em operações com múltiplos joins, o nó único foi mais eficiente, pois o overhead de shuffle na rede no ambiente distribuído acabou por neutralizar os benefícios da paralelização de dados. Este detalhe é crucial para arquitetos de dados ao decidir sobre a infraestrutura ideal.

Outras categorias