O Spotify implementou uma solução inovadora para otimizar a performance de consultas em seus data lakes de petabytes. A abordagem consiste em um índice externo que associa chaves diretamente a offsets de arquivos e números de linha em arquivos Parquet, sem a necessidade de modificá-los. Essa estratégia permite substituir scans SQL distribuídos por leituras paralelas de intervalos, agilizando significativamente o processo. Adicionalmente, otimizações como descarga de página por chave, redefinições de frame ZSTD, intercalação de colunas e entradas de índice de cobertura minimizam os bytes lidos e o tráfego de rede, viabilizando que os mesmos arquivos atendam tanto a processamento em lote quanto a consultas interativas em tempo real.

CEVIU News - CEVIU Dados - 30 de julho de 2026
🎧 CEVIU Dados
A Airbnb está na vanguarda da avaliação de sistemas de IA generativa (GenAI), empregando uma metodologia que prioriza a revisão de centenas de protótipos para identificar vulnerabilidades antes da automação. Sua arquitetura de avaliação integra verificações programáticas e avaliadores baseados em LLMs calibrados, alcançando uma impressionante taxa de concordância superior a 80% com julgadores humanos. Para sistemas agentic, a análise aprofundada abrange não apenas os resultados finais, mas também as chamadas de ferramentas e as etapas de raciocínio, garantindo robustez e confiabilidade na implementação.
O Pinterest implementou uma estratégia inovadora para otimizar a experiência do usuário, substituindo os embeddings de usuário únicos por clusters aglomerativos dinâmicos. Essa abordagem utiliza os últimos 500 engajamentos de cada usuário, juntamente com metadados de ciclo de vida que monitoram a recenticidade e frequência. Os clusters gerados alimentam as camadas de recuperação, ranqueamento e "blending" da plataforma, com os estágios de ciclo de vida do usuário ditando o peso dos sinais de utilidade durante o ranqueamento, resultando em um crescimento não linear na retenção, que se intensifica conforme os usuários adotam mais casos de uso.
A Atlassian concluiu a migração de seu sistema de processamento de eventos do Kinesis para o Kafka, aproveitando o AWS MSK, para gerenciar um crescimento exponencial no tráfego, que saltou de 22 bilhões para 150 bilhões de eventos diários. Apesar da otimização de custos proporcionada pelo uso de Tiered Storage, a empresa superou desafios como limites de brokers, S3, control-plane e disco. A implementação estratégica de cotas, sharding, capacidade sobressalente, backups e failovers foi fundamental para a escalabilidade bem-sucedida de sua robusta infraestrutura de dados.
O cenário das plataformas de streaming de dados está em plena evolução, com novos players buscando alternativas ao tradicional Kafka. Enquanto Iggy aposta em Rust, TCP, QUIC e HTTP para sua arquitetura, S2 inova com o uso de HTTP e armazenamento de objetos para garantir retenção ilimitada. Já o OpenData Log redefine a lógica de particionamento, implementando roteamento baseado em chaves. A grande questão que se impõe é se essas novas tecnologias se tornarão complementares ao Kafka ou se representam uma verdadeira substituição no ecossistema de dados em tempo real.
A LangChain anunciou a reestruturação completa de sua stack de dados, implementando uma abordagem pioneira voltada para a análise nativa de agentes. Em apenas seis semanas, a empresa realizou a migração total de sua plataforma de Business Intelligence anterior. A nova arquitetura integra definições dbt, modelos semânticos robustos, conjuntos de dados confiáveis e utiliza os guias e traces do LangSmith. Essa combinação estratégica permite que os agentes de IA gerem consultas SQL com alta precisão, ao mesmo tempo em que a equipe de dados mantém controle rigoroso sobre a modelagem e a governança, garantindo a integridade e confiabilidade das informações.
A adoção de "canonicals componíveis" emerge como uma solução para codificar o conhecimento de domínio em modelos de dados versionados, superando a fragmentação do conhecimento. Esta abordagem propõe a segregação em camadas distintas: uma camada "source" para definir transformações e ontologia, e uma camada de negócio que harmoniza identidades entre diversos sistemas. O grande diferencial é a habilidade de agentes de IA em utilizar conceitos "estáveis" e regras de identidade intrínsecas, indo além da simples manipulação de tabelas para uma compreensão mais profunda dos dados. Isso promete otimizar o processamento e a qualidade dos dados, fundamentais para a inteligência analítica.
O RocksDB, motor de armazenamento amplamente utilizado, implementa o controle de concorrência multi-versão (MVCC) por meio de números de sequência para marcação de chaves. Essa estratégia permite que leitores mantenham uma visão consistente dos dados, enquanto operações de escrita ocorrem de forma não bloqueante. Para transações, o RocksDB oferece abordagens pessimistas, com bloqueios de escrita, e otimistas, que verificam conflitos no commit via mutexes pré-hasheados. Curiosamente, soluções robustas como TiDB e CockroachDB preferem desenvolver suas próprias camadas transacionais, optando por não utilizar os mecanismos nativos do RocksDB para transações.
O Apache SeaTunnel emerge como uma solução robusta para o desafio de gerenciar inúmeros scripts de ingestão de dados. Ele endereça a duplicação de funcionalidades como gerenciamento de conexões, retentativas, checkpoints, idempotência, concorrência e observabilidade, que são comuns em implementações manuais. Com seu modelo Source-Transform-Sink, o framework desassocia a definição declarativa dos pipelines da sua execução, centralizando o comportamento dos conectores e do runtime, oferecendo uma alternativa moderna e eficiente para orquestração de dados.
Contrariando a percepção comum, a verdadeira ameaça de um incidente sério envolvendo IA pode residir nos laboratórios de ponta que desenvolvem sistemas fechados, e não em modelos de código aberto. A vulnerabilidade a vazamentos internos nesses ambientes é uma preocupação primordial. Além disso, modelos abertos atualmente não possuem a profundidade de conhecimento necessária para gerar riscos imediatos em áreas sensíveis como a biologia, e a restrição ao acesso a essas tecnologias pode, paradoxalmente, beneficiar mais atores mal-intencionados do que os defensores da segurança.
Em 2026, a observabilidade de agentes tornou-se um pilar fundamental em ambientes de produção, com 73% das empresas hesitando em implementar agentes sem monitoramento robusto, conforme apontado pela Monte Carlo. Apesar do avanço em ferramentas de tracing, avaliação e gateways, o mercado ainda enfrenta uma lacuna crítica: a maioria das soluções monitora o agente em si, mas falha em rastrear e alertar sobre problemas de qualidade, linhagem ou atualização dos dados que o alimentam. Este cenário ressalta a necessidade urgente de uma abordagem mais holística que contemple todo o ciclo de vida dos dados, desde a origem até o consumo pelo agente.
O CockroachDB sugere uma abordagem unificada para gerenciar dados transacionais, estados efêmeros e embeddings, visando aprimorar a infraestrutura de aplicações de IA em produção. A proposta centraliza esses dados em uma única solução que oferece funcionalidades cruciais como SQL serializável, TTL (Time-to-Live) em nível de linha, changefeeds e indexação vetorial distribuída. Essa consolidação busca simplificar a arquitetura de dados e melhorar a eficiência operacional para sistemas complexos de IA.
Sistemas de armazenamento em colunas largas, como Cassandra, Bigtable e ScyllaDB, destacam-se no processamento de grandes volumes de dados, as chamadas 'firehose workloads', e em cenários de leituras previsíveis de partição única. Sua arquitetura é otimizada para essas operações específicas, garantindo alta performance e escalabilidade. Contudo, é crucial notar que esses sistemas não foram projetados para consultas SQL ad hoc complexas ou para a execução eficiente de operações de junção (joins), limitando sua aplicação em contextos que demandam tal flexibilidade.
Receba as melhores notícias de tech
Conteúdo curado diariamente, direto no seu e-mail.
