CEVIU Dados
Todas as notícias

CEVIU Dados

Big data, ciência de dados e engenharia de dados

691 notícias

Pontuações de testes de IA convencionais não se mostram eficazes para bots de atendimento ao cliente, que exigem a manutenção de conversas contínuas, a compreensão de intenções subjacentes e a capacidade de levar usuários a compartilhar informações de contato. ️ Para superar essa limitação, a equipe desenvolveu um sistema de avaliação aprimorado. Este novo sistema combina a análise humana para os pontos mais desafiadores, com a pontuação automática por LLMs (LLM-as-judge) para garantir escalabilidade. Além disso, inclui verificações pontuais feitas por humanos para identificar e corrigir casos problemáticos.

O PostgreSQL está implementando uma versão de alta concorrência para seus índices B-tree, conhecida como Blink-tree. Esta nova abordagem incorpora um ponteiro "link" simples entre nós irmãos e um marcador de limite "high-key" em cada nó, otimizando o desempenho e a gestão de concorrência. ️ Com essa arquitetura, as operações de busca podem navegar rapidamente para o nó irmão direito, quando necessário, sem a necessidade de manter locks em múltiplos níveis – eliminando o "lock-coupling" durante as leituras. Já as modificações estruturais, como page splits, empregam um breve "lock-coupling" de baixo para cima, agindo em poucos nós por vez, o que reduz significativamente a contenção de locks.

Quando sistemas RAG baseados em HNSW excedem cerca de 100 mil vetores, a latência cresce super linearmente e o recall diminui , frequentemente retornando resultados muito similares, mas irrelevantes para consultas raras. As causas incluem armadilhas de mínimos locais, hubness em altas dimensões e pressão de memória. As mitigações ️ incluem o ajuste de M, ef_construct e ef_search, o uso de retrieval híbrido em duas etapas, a aplicação de quantização com oversampling e rescoring, e a dependência de engines otimizados como o Qdrant.

O formato colunar Vortex da SpiralDB implementa a Compressão Cascata, uma abordagem recursiva e orientada por dados que encadeia múltiplas codificações leves e de rápida decodificação por coluna. Essa técnica avalia esquemas em amostras estratificadas (aproximadamente 1% dos dados) e seleciona o melhor caminho otimizado de forma gulosa. Ela comprime recursivamente as saídas intermediárias, como códigos, dicionários e tamanhos, em uma árvore com profundidade limitada, o que permite lidar eficientemente com distribuições de dados assimétricas, agrupadas ou mistas, sem a necessidade de depender de um codec fixo como o ZSTD.

A Tencent Games implementou uma arquitetura de analytics em tempo real , utilizando os princípios de CQRS e event sourcing. Para isso, a empresa emprega Apache Pulsar para ingestão de eventos de alta vazão e ScyllaDB para distribuir eficientemente eventos a milhões de sessões de jogo. Eles particionam os eventos usando IDs de sessão e aproveitam os keyspaces do ScyllaDB, juntamente com a replicação de dados entre regiões, para otimizar o gerenciamento de dados multi-tenant. Este design desacopla a lógica da aplicação da distribuição de dados, entregando operações de baixa latência e consistência global, essenciais para o monitoramento de risco e a moderação dentro do jogo.

A engenharia de analytics está ressurgindo à medida que camadas semânticas, contexto de IA e lógica de negócio estruturada se tornam críticos em níveis estruturais, de mensuração e interpretativos. O dbt moldou o papel, mas o restringiu ao SQL. Com agentes de IA consumindo lógica de negócio, a ambiguidade se torna mais arriscada, tornando essencial uma forte engenharia de contexto e semântica clara para manter os dados confiáveis e prontos para máquinas.

Hardwood é um parser Parquet leve e de código aberto para Java 21+, construído para leitura multi-threaded de alto throughput com dependências mínimas. Utilizando paralelismo em nível de página, prefetching adaptativo e mapeamento de memória, ele pode ler 9.2GB ou 650 milhões de linhas em cerca de 1.2 segundos em 16 núcleos, superando em mais de duas vezes a velocidade de leituras linha a linha. A ferramenta oferece APIs de linha e coluna com amplo suporte a compressão e tem suporte a predicate pushdown planejado.

A Uber Engineering descentralizou seu data warehouse monolítico Hive ao implementar a Federação de Bancos de Dados. Esse processo envolveu a migração de conjuntos de dados para bancos de dados Hive menores, de domínio ou de equipes, sem duplicação de dados ou tempo de inatividade. Isso foi possível graças a um Bootstrap Migrator único, que copiou os dados para novas localizações no HDFS e atualizou os ponteiros. Enquanto isso, sincronizadores em tempo real (Apache Flink + Piper) e em batch garantiram a consistência bidirecional dos metadados do HMS.

O Dropbox aprimorou a relevância da busca no Dropbox Dash ao combinar um pequeno conjunto inicial de julgamentos de relevância consulta-documento, rotulados por humanos e de alta qualidade, com a rotulagem assistida por LLMs. Essa abordagem escalou os dados de treinamento em cerca de 100 vezes . A equipe otimizou os prompts dos LLMs com dados humanos para minimizar discordâncias, e então empregou o LLM calibrado offline como um "professor", gerando um grande volume de rótulos sintéticos a partir de amostras representativas ou com potencial de erro .

Sistemas de IA baseados em agentes aceleram a escrita de código, mas seu principal efeito é amplificar a maturidade existente das equipes: equipes fortes aprimoram-se mais rapidamente, enquanto equipes mais fracas geram mais bugs e riscos. O gargalo de desenvolvimento e operação, por sua vez, migra para testes, CI/CD, segurança, governança e o atrito com sistemas legados. Espera-se um quadro com menos engenheiros, mas com habilidades mais elevadas, e que os melhores resultados virão de líderes que investem em capacitação, e não apenas em cortes de pessoal.

Modelos de dados tradicionais e camadas semânticas frequentemente desconsideram o significado real do negócio, fazendo com que sistemas de IA acabem inferindo contextos e gerando respostas confiantes, mas incorretas. Ao adicionar uma ontologia clara – um mapa estruturado de como o negócio realmente funciona – a IA ganha capacidade de entender causa e efeito. Isso permite ir além de relatórios básicos para gerar insights estratégicos verdadeiros .

A Flipkart substituiu seu sistema legado Agreement Master (AGM) pela nova Rate Card Platform (RCP), projetada para entregar milhares de QPS com latência P99 abaixo de 100ms para precificação complexa baseada em liquidação em todos os seus marketplaces. A RCP permite avaliação de regras hierárquicas e baseadas em prioridade, modelagem de dados desnormalizada, arquitetura fan-out orientada a eventos e utiliza o Aerospike para leituras escaláveis e de alta performance. Os resultados incluem uma melhoria de 10x na escala, cálculos de taxas determinísticos e flexibilidade robusta para suportar casos de negócio em evolução.

Ferramentas chave de versionamento de dados, como LakeFS, Dolt, Nessie, MotherDuck, Bauplan, DuckLake e Neon, possibilitam workflows tipo Git ️. Elas fazem isso ao separar metadados dos dados e alavancar copy-on-write, manipulação de ponteiros e clonagem zero-copy para fornecer branching instantâneo e não duplicativo para data lakes, bancos de dados e data warehouses. Cada plataforma oferece trade-offs distintos: LakeFS e Nessie, por exemplo, impulsionam workflows de full-merge para object stores, enquanto Dolt permite o versionamento de tabelas SQL em nível de célula. Neon e Supabase, por sua vez, criam branches de ambientes Postgres inteiros. As capacidades de controle de versão no estilo Git também se expandem para a orquestração de dados .

A automação impulsionada por IA comprimiu radicalmente o mercado de tooling de dados , eliminando 60–70% do valor de fornecedores em 18 meses, à medida que workflows de ponta a ponta tornam as fronteiras de categorias obsoletas. Apenas profissionais com profundo contexto de negócio, modelagem de dados e expertise arquitetônica registraram aumento de remuneração , enquanto funções de engenharia rotineira foram automatizadas ou realocadas para a "supervisão de pipelines de IA" com menor custo . Habilidades fundamentais, como compreensão de negócios, governança e conhecimento institucional, tornaram-se os verdadeiros diferenciais, à medida que o número de funcionários diminui e a consolidação de plataformas se acelera.

O poder da IA reside menos no modelo em si e mais na ontologia de dados e na infraestrutura subjacente ️ que conecta, governa e molda a informação antes da execução de qualquer algoritmo. A verdadeira vantagem competitiva está na estrutura, controle e implantação dos sistemas de dados , e não apenas na camada de inteligência aplicada por cima .

Outras categorias