CEVIU Logo

CEVIU News

As melhores notícias de tecnologia, curadas diariamente para quem vive tech.

222 notícias encontradas

Para agentes de IA empresariais, a busca por vetores e o Retrieval Augmented Generation (RAG) não são suficientes. Embora o RAG consiga identificar passagens relevantes, ele não garante a preservação de limites de origem, o significado de negócio, a propriedade ou as restrições de uso dos dados. A solução proposta foca na construção de um modelo de produto de dados governado, compilado em diversas representações, como grafos, wikis Markdown, pacotes OKF e sidecars compactos (TOON/GCF). Isso demonstra que a preparação para a IA não se resume a um catálogo, mas sim a um contexto conectado, confiável e a operações repetíveis, garantindo que a IA opere com dados estruturados e bem definidos.

O vindouro Postgres 19 trará uma importante otimização na gestão de armazenamento, substituindo a compressão padrão de objetos TOAST do algoritmo pglz para o LZ4. Esta mudança, que será integrada ao framework unificado de compressão, abrange não apenas o armazenamento em heap, mas também TOAST e índices B-tree. Tipos de dados de comprimento variável como TEXT, VARCHAR, BYTEA e JSONB, que superam o limite de aproximadamente 2 KB, serão automaticamente beneficiados. Testes preliminares apontam que o LZ4 oferece desempenho superior ao pglz, garantindo compressão mais eficiente e detecção rápida de dados incompressíveis, resultando em maior eficiência e menor latência para operações de banco de dados.

CEVIU Dados🔮 Rumor

A Databricks, empresa que se consolidou no mercado de dados, está prestes a levantar US$3 bilhões, o que catapultaria seu valor de mercado para a impressionante cifra de US$188 bilhões. Este movimento estratégico reflete a bem-sucedida transição da companhia de uma plataforma de dados robusta para um dos principais fornecedores de soluções de IA para o setor corporativo, consolidando sua posição no cenário tecnológico global.

No recente evento VB Transform 2026, empresas como LinkedIn, Walmart e Zendesk compartilharam suas abordagens inovadoras para superar os desafios da infraestrutura legada frente à velocidade dos agentes de IA. O LinkedIn destacou a importância de pré-provisionar containers e a transição de 80% da orquestração para código determinístico. Já o Walmart focou na governança de agentes internos duplicados, enquanto a Zendesk aprimorou seus pipelines de dados para processar um volume massivo de 20 bilhões de conversas. As lições aprendidas apontam para a necessidade de avaliações contínuas, controle sobre o 'agent harness' e a portabilidade das cargas de trabalho entre diferentes modelos.

A Razorpay alcançou uma redução de 90% no tempo de atualização de seu data warehouse ao substituir a varredura completa de tabelas por uma estratégia incremental baseada em grafos. A abordagem utiliza uma camada silver para desduplicar alterações diárias por chave primária, enquanto índices secundários armazenam colunas de junção e metadados de partição para evitar "full scans". O processamento com travessia de grafo atua apenas nas linhas modificadas, realizando um "back-traversal" eficiente das dependências para enriquecer as atualizações de forma otimizada.

A proliferação desordenada de dashboards em ambientes corporativos gera custos significativos, como a diminuição da confiança nos dados, o desperdício de recursos computacionais do data warehouse e a manutenção de artefatos obsoletos. Um cenário comum revela que, de centenas de dashboards disponíveis, apenas uma pequena parcela é de fato acessada, com aproximadamente 90% permanecendo sem uso. Para mitigar esse problema, surge a "Regra 90/90", uma abordagem prática de gestão do ciclo de vida: dashboards inativos por 90 dias devem ser arquivados e, se permanecerem sem demanda por mais 90 dias, devem ser permanentemente excluídos. Esta metodologia visa otimizar os recursos e garantir a relevância das informações analíticas.

A Prefect anunciou a aquisição da Dagster, em um movimento estratégico que visa consolidar a orquestração de dados open-source. Ambas as plataformas manterão seus nomes, modelos de precificação e roteiros de desenvolvimento independentes. A fusão adicionará cerca de 40 funcionários à equipe da Prefect, combinando as robustas capacidades de rastreamento de resultados da Dagster com a eficiência de execução da Prefect e a tecnologia FastMCP para impulsionar inovações no ecossistema de dados.

Um estudo recente comparou o desempenho do Polars em configuração distribuída (32 nós) contra um nó único m8i.32xlarge, ambos com especificações agregadas similares (128 vCPUs, 512GB RAM) em um benchmark TPC-H de 1TB. Os resultados mostraram que o Polars distribuído teve uma leve vantagem em queries intensivas em I/O, aproveitando uma largura de banda de rede de 400 Gbps, superior aos 50 Gbps sustentados do nó único. Contudo, em operações com múltiplos joins, o nó único foi mais eficiente, pois o overhead de shuffle na rede no ambiente distribuído acabou por neutralizar os benefícios da paralelização de dados. Este detalhe é crucial para arquitetos de dados ao decidir sobre a infraestrutura ideal.

Ferramentas como Apache Hudi, Iceberg e Delta Lake estão transformando o panorama dos Data Lakes, ao introduzir a conformidade ACID (Atomicidade, Consistência, Isolamento, Durabilidade) diretamente no armazenamento de objetos. Essa inovação é crucial para a integridade dos dados, utilizando logs de metadados e um mecanismo de publicação atômica. Essencialmente, as escritas multi-arquivo só se tornam visíveis após uma operação final de metadados, que publica a alteração de forma atômica, garantindo que os consumidores sempre acessem um snapshot consistente dos dados. As garantias ACID, no entanto, aplicam-se por tabela, com commits processados em segundos e isolamento baseado em snapshot, não sendo completamente serializável. Este avanço é fundamental para arquiteturas de dados modernas que buscam maior confiabilidade e consistência.

A construção de um pipeline de memória para agentes de IA pode ser estruturada como um sistema de ontologia robusto. Este processo engloba o armazenamento de dados, a extração de objetos de grafos através de LLMs, a validação e deduplicação desses objetos e sua disponibilização para consultas padrão e buscas mais aprofundadas via Memory-Comprehension-Perception (MCP). Para tal, o MongoDB destaca-se pela eficácia em buscas textuais, vetoriais e de grafos, reservando-se bancos de dados de grafos tradicionais para travessias complexas e lógicas centrais.

O Grab, gigante do sudeste asiático, concluiu a migração de suas tabelas Hive Parquet em escala de petabytes para o Apache Iceberg, um movimento estratégico que resultou em melhorias significativas. A adoção do Iceberg gerou uma impressionante aceleração de 10x na velocidade das consultas e uma notável redução de 95% nos custos diários de API do S3 para tabelas operacionais. Adicionalmente, a empresa alcançou uma economia de 50% no poder computacional para seus pipelines de Machine Learning, além de desenvolver um UnifiedSparkCatalog personalizado, capaz de unificar e gerenciar tabelas Iceberg, Delta, Hudi e Hive por meio de uma única interface com lógica de fallback e compatibilidade com Hive.

A Netflix implementou um robusto sistema de topologia de serviços, estruturado em três camadas e alimentado por logs de fluxo eBPF, métricas de aplicação e traces distribuídos. A solução integra um pipeline de streaming em três estágios que agrega dados, resolve dependências de balanceadores de carga e persiste um grafo consultável com latência em microssegundos. O principal desafio enfrentado foi a gestão de uma variância de carga de 100x, decorrente do tráfego que, seguindo uma lei de potência, concentra-se em serviços populares. Essa complexidade foi superada com uma estratégia de redistribuição multiestágios, otimizando o processamento de dados em escala.

O Expedia Group revela os pilares de sua arquitetura de IA, enfatizando a necessidade de que cada modelo esteja diretamente atrelado a resultados de negócio mensuráveis. A empresa adota uma abordagem de plataforma unificada, evitando stacks customizadas para garantir escalabilidade e manutenção. Adicionalmente, estabelece proprietários claros nas áreas de negócios, produto, IA e operações, promovendo a responsabilidade e governança em todo o ciclo de vida da IA.

A Cloudflare anunciou a aquisição da Arroyo, um processador de stream SQL construído em Rust, visando fortalecer sua Plataforma de Desenvolvedores. A ferramenta, conhecida por suportar operações complexas como junções e agregações com estado, continuará como projeto open source sob a licença Apache 2.0. Inicialmente, a tecnologia da Arroyo será integrada aos Cloudflare Pipelines, adicionando robusta capacidade de processamento SQL em tempo real à infraestrutura da Cloudflare.

Arquiteturas de camadas de cache enfrentam desafios críticos de escalabilidade, como sobrecargas causadas pela expiração de chaves populares, o impacto de chaves quentes em nós únicos, dados desatualizados por invalidações concorrentes e avalanches de cache após falhas que sobrecarregam o backend. Para assegurar robustez e desempenho, especialistas recomendam o uso de jitter de TTL, unificação de requisições, técnicas de divisão de chaves e hashing consistente com nós virtuais, mitigando riscos e otimizando a resiliência dos sistemas de dados.

O método G-Eval propõe uma forma inovadora de avaliar textos gerados por Large Language Models (LLMs) através da automação dos passos de pontuação por outro LLM. Utilizando a técnica de *chain-of-thought*, a abordagem gera rubricas dinamicamente e calcula uma expectativa ponderada das probabilidades em nível de token para cada pontuação, resultando em maior estabilidade. Para aprimorar a confiabilidade, sugere-se a adoção de um modelo de "juiz" de uma família de modelos distinta e a calibração das rubricas com exemplos rotulados por humanos, prometendo um avanço significativo na governança de qualidade de conteúdo gerado por IA.

Empresas sem profissionais dedicados à propriedade de produtos de dados desperdiçam 45% do tempo da equipe em tarefas reativas, contrastando com os 27% observados em equipes com responsabilidades bem definidas. Essa disparidade surge quando organizações falham em designar donos claros para dashboards, conjuntos de dados ou modelos. A adoção de ferramentas de IA intensifica essa diferença: equipes com propriedade estabelecida registram um aumento de 18 pontos percentuais no sentimento positivo, enquanto aquelas sem essa clareza experimentam uma queda de 26 pontos, evidenciando o impacto crítico da governança de dados na eficácia e percepção do trabalho.

O PostgreSQL demonstra capacidade de realizar o pruning de partições de forma eficiente, mesmo quando as consultas envolvem filtros em colunas que não são chaves de partição. Essa otimização é viável ao correlacionar colunas com intervalos previsíveis e a chave de partição. A implementação de constraints do tipo CHECK, especificando esses intervalos e tratando valores atípicos em faixas separadas, permite que o otimizador ignore partições irrelevantes. Tal abordagem evita a varredura desnecessária de todos os índices locais, resultando em uma melhoria significativa no desempenho das consultas.

A Arcesium, gigante em serviços financeiros e de tecnologia, transformou seu data warehousing ao migrar um repositório de P&L de 170TB e 15 trilhões de registros de um RDBMS tradicional para uma arquitetura baseada em Apache Iceberg no S3, orquestrada por DuckDB. Essa transição estratégica, que incluiu o desenvolvimento da camada Swiftlake e a adoção de KEDA para autoescalonamento no Kubernetes, resultou em uma impressionante redução de 80% no tempo de ingestão para grandes carteiras. Além disso, a empresa conseguiu minimizar timeouts de egress e otimizar custos de infraestrutura em aproximadamente 40%, aproveitando ainda os recursos de time-travel do Iceberg para recuperação de dados.