CEVIU Logo
CEVIU News

CEVIU News - CEVIU Dados - 20 de julho de 2026

11 notícias20 de julho de 2026CEVIU Dados
Compartilhar:

⚡️ CEVIU Dados

O Apache Spark 4.2 acaba de ser lançado, apresentando uma série de melhorias que reforçam sua posição como ferramenta central no processamento de dados. Entre as novidades, destacam-se as "metric views" para a definição de métricas de negócio, a busca de similaridade via SQL vector e a introdução de tipos geoespaciais nativos. A versão também incorpora queries de Change Data Capture (CDC) através da nova cláusula CHANGES, otimizando a sincronização de dados. A facilidade de uso foi aprimorada com o Spark Connect e a execução padrão otimizada com Arrow para Python. Com mais de 1.900 commits de 260 contribuidores, o Spark 4.2 promete maior eficiência e flexibilidade para o ecossistema de dados.

O Apache DataFusion Comet eleva o desempenho de leitura do Spark em tabelas Iceberg, combinando o planejamento de queries em Java com a execução nativa Arrow via Iceberg Rust. Testes de benchmark TPC-DS de 3 TB demonstraram um salto significativo: 102 de 103 queries aceleradas e uma redução de aproximadamente 40% no tempo total de execução. Adicionalmente, a interoperabilidade com os pacotes de testes Spark do Iceberg Java foi crucial, impulsionando mais de 40 pull requests que aprimoraram o Iceberg Rust.

A Meta está aprimorando a otimização de seu funil de anúncios por meio de uma abordagem inovadora: a compressão de bilhões de usuários e entidades em clusters de interesses latentes. Estes são enriquecidos com conteúdo de anúncios processado por Large Language Models (LLMs), incorporando tudo em um espaço compartilhado para pontuar qualquer usuário ou entidade. Ao aprender com a estrutura ampla do grafo, e não apenas com eventos de conversão raros, a Meta obtém um sinal robusto para o funil profundo, alimentando modelos de ranking de anúncios como GEM e Andromeda. Essa estratégia promete maior precisão e relevância em suas campanhas.

No recente evento VB Transform 2026, empresas como LinkedIn, Walmart e Zendesk compartilharam suas abordagens inovadoras para superar os desafios da infraestrutura legada frente à velocidade dos agentes de IA. O LinkedIn destacou a importância de pré-provisionar containers e a transição de 80% da orquestração para código determinístico. Já o Walmart focou na governança de agentes internos duplicados, enquanto a Zendesk aprimorou seus pipelines de dados para processar um volume massivo de 20 bilhões de conversas. As lições aprendidas apontam para a necessidade de avaliações contínuas, controle sobre o 'agent harness' e a portabilidade das cargas de trabalho entre diferentes modelos.

Para agentes de IA empresariais, a busca por vetores e o Retrieval Augmented Generation (RAG) não são suficientes. Embora o RAG consiga identificar passagens relevantes, ele não garante a preservação de limites de origem, o significado de negócio, a propriedade ou as restrições de uso dos dados. A solução proposta foca na construção de um modelo de produto de dados governado, compilado em diversas representações, como grafos, wikis Markdown, pacotes OKF e sidecars compactos (TOON/GCF). Isso demonstra que a preparação para a IA não se resume a um catálogo, mas sim a um contexto conectado, confiável e a operações repetíveis, garantindo que a IA opere com dados estruturados e bem definidos.

O vindouro Postgres 19 trará uma importante otimização na gestão de armazenamento, substituindo a compressão padrão de objetos TOAST do algoritmo pglz para o LZ4. Esta mudança, que será integrada ao framework unificado de compressão, abrange não apenas o armazenamento em heap, mas também TOAST e índices B-tree. Tipos de dados de comprimento variável como TEXT, VARCHAR, BYTEA e JSONB, que superam o limite de aproximadamente 2 KB, serão automaticamente beneficiados. Testes preliminares apontam que o LZ4 oferece desempenho superior ao pglz, garantindo compressão mais eficiente e detecção rápida de dados incompressíveis, resultando em maior eficiência e menor latência para operações de banco de dados.

A Trellis introduz os "experience graphs" como uma inovadora arquitetura de dados para o armazenamento persistente de artefatos de agentes, recompensas, dados de busca e histórico causal. Acessíveis via SQL, grafos, vetores e consultas temporais, essa abordagem permite que agentes de IA se autoaprimorem de forma eficiente. Pesquisas da Meta demonstraram que a reutilização de experiências anteriores acelera o desempenho em até 10 vezes e reduz os custos de token em 52% para soluções bem-sucedidas. Contudo, um reuso excessivo de memória pode impactar negativamente a capacidade de exploração dos agentes.

A Netflix implementou uma plataforma unificada para operar seus serviços de LLMs internamente, evitando APIs externas. A arquitetura, baseada em JVM com gRPC e uma API HTTP compatível com OpenAI, padroniza a implantação via Model Scoring Service. Este serviço é suportado pelo Triton e utiliza o vLLM como motor principal, após rigorosos testes de benchmark. A solução ainda inclui empacotamento customizado, atualizações sem interrupção e decodificação guiada, com patches específicos para garantir a correta geração de saídas JSON, otimizando performance e controle da IA.

A Airbnb implementou uma estratégia inovadora para acelerar a avaliação de Grandes Modelos de Linguagem (LLMs), condensando ciclos que antes levavam semanas para menos de um dia. A metodologia se apoia no caching inteligente de referências e pontuações de julgadores, otimizando o processo ao identificar que mais da metade das saídas de modelos candidatos são strings idênticas, com uma variação mínima de 1% no desempenho do julgador. Para ajustes rápidos, adaptadores LoRA de baixo rank são treinados em menos de uma hora utilizando uma única GPU, permitindo correções no mesmo dia. O processo é finalizado com uma etapa de validação em tráfego amostrado, assegurando a identificação de possíveis falhas em tempo real.

A Databricks, empresa que se consolidou no mercado de dados, está prestes a levantar US$3 bilhões, o que catapultaria seu valor de mercado para a impressionante cifra de US$188 bilhões. Este movimento estratégico reflete a bem-sucedida transição da companhia de uma plataforma de dados robusta para um dos principais fornecedores de soluções de IA para o setor corporativo, consolidando sua posição no cenário tecnológico global.

A recente aquisição da Dremio pela SAP sinaliza um desafio crescente para plataformas de dados que operam exclusivamente com o modelo lakehouse. A integração, em vez da substituição, da tecnologia da Dremio no SAP Datasphere sugere que as demandas da IA – que incluem amplo alcance de dados, frescor em tempo real e capacidade de consultas imprevisíveis – podem superar a capacidade de arquiteturas puramente lakehouse. Isso indica uma tendência em direção a abordagens mais híbridas e integradas para atender às necessidades complexas da análise e do aprendizado de máquina impulsionados pela IA.

Receba as melhores notícias de tech

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser