CEVIU News

CEVIU News - CEVIU Dados - 15 de setembro de 2026

13 notícias15 de setembro de 2026CEVIU Dados
Compartilhar:

📊 CEVIU Dados

O ChatGPT Work acaba de apresentar um agente de dados inovador, projetado para capacitar colaboradores a interagir e explorar dados corporativos aprovados, bem como definições de negócio, utilizando apenas linguagem natural. A ferramenta permite a criação de painéis compartilháveis, integrando-se nativamente a plataformas de dados e ferramentas de BI já existentes. Além disso, garante a aderência às permissões de acesso e pode recomendar ou executar ações de acompanhamento previamente autorizadas, prometendo otimizar a inteligência analítica nas empresas.

O Lyft anunciou a reconstrução de seu dataset de tempo de viagem entre bairros, que se encontrava obsoleto. A atualização incorpora ETAs (Estimativas de Tempo de Chegada) mais precisos, expande a cobertura geográfica e inclui a filtragem de locais acessíveis por veículos, além de campos de autoatendimento para maior flexibilidade. Essa reformulação visa aprimorar a precificação dinâmica e a visualização dos mapas de calor para motoristas, oferecendo uma compreensão mais acurada da oferta disponível. O sistema agora será atualizado semestralmente, com planos futuros de integrar ETAs sensíveis ao tempo, que refletirão as variações do tráfego ao longo da semana, otimizando ainda mais a eficiência operacional da plataforma.

O Pinterest está aprimorando sua plataforma Manas, responsável por gerenciar bilhões de embeddings que alimentam funcionalidades cruciais como o Home Feed, busca, pins relacionados, anúncios e notificações. As otimizações implementadas incluem técnicas de quantization, que já resultaram em uma economia de 20-30% nos custos de serving. Além disso, a empresa experimenta com Approximate Nearest Neighbor (ANN) suportado por SSD, visando reduzir significativamente a demanda por memória e CPU. Em um avanço estratégico, a busca por multi-embedding está sendo desenvolvida para ir além do matching de vetor único, permitindo uma pontuação de candidatos mais robusta e contextualizada.

O conceito de Kafka sem disco promete revolucionar a persistência de dados ao desvincular o armazenamento de payload dos logs dos brokers, movendo-o para object storage e metadados fortemente consistentes. Embora mantenha a API original do Kafka, essa abordagem altera profundamente aspectos como batching, atribuição de offsets, recuperação e compactação, além de impactar a latência. A inovação não só oferece retenção de dados mais econômica, mas também posiciona os tópicos sem disco como uma solução estratégica para workloads específicas, em vez de uma substituição completa ao Kafka tradicional, abrindo novas fronteiras para arquiteturas de dados.

Ferramentas de IA para codificação têm facilitado a criação de schemas para PostgreSQL, mas com uma inclinação a adicionar índices em tabelas de alto tráfego. Uma análise detalhada de workloads de tickets de suporte revelou que índices adicionais podem quase dobrar o tempo de atualização e o volume de WAL (Write-Ahead Log), além de sobrecarregar o processo de VACUUM. A otimização de índices deve ir além da análise de planos de leitura, considerando as evidências do "write-path", a relevância de HOT-updates e os contadores de uso para garantir a performance ideal.

Mesmo após aprovação em CI e avaliações, agentes de IA podem falhar ao fornecer respostas corretas, por recuperarem contextos inválidos ou seguirem rotas de execução defeituosas. Para garantir a confiabilidade, a depuração com rastreamentos de ponta a ponta é fundamental. Isso inclui monitorar chamadas de modelo e de ferramentas, além das entradas e saídas de retrieval, complementado por testes rigorosos para assegurar um comportamento determinístico e a qualidade final das respostas geradas pela IA.

A PlanetScale demonstrou um marco impressionante ao escalar seu novo sistema Postgres sharded, Neki, de 1 milhão para 118 milhões de queries por segundo. Inicialmente, o objetivo de 1 milhão de queries foi atingido em apenas 5 shards. Posteriormente, a arquitetura foi expandida para 512 shards, processando a impressionante marca de 118 milhões de queries por segundo em um volume de 1.22 PiB de dados. A carga de trabalho, configurada para seleções de ponto em um único shard sem escritas ou joins complexos, validou uma curva de escalabilidade linear e robusta para cenários de alta leitura.

O DuckDB 2.0 chega com melhorias notáveis para o ecossistema de dados, impulsionando o desempenho de consultas S3 em 2 a 3 vezes, graças à implementação de I/O assíncrono. A nova versão otimiza significativamente consultas recursivas profundas e aprimora o manuseio de dados semi-estruturados, tornando o tipo VARIANT mais compacto e veloz que JSON. Além disso, a atualização incorpora recursos SQL práticos, como triggers, schemas aninhados e Common Table Expressions (CTEs) com capacidade de modificação de dados, fortalecendo a ferramenta para análises e engenharia de dados.

Muitas análises sobre o impacto da adoção de IA podem superestimar seus benefícios ao comparar empresas que a utilizam com aquelas que não a utilizam. Isso ocorre porque clientes e empresas mais engajados tendem a ser os primeiros a adotar novas tecnologias. Para uma estimativa mais precisa da causalidade, é fundamental focar em variações na adoção que não sejam resultado de escolhas dos clientes, como critérios de elegibilidade predefinidos. As conclusões devem ser restritas à população e à decisão específica que estão sendo mensuradas, garantindo uma avaliação mais robusta e menos enviesada do verdadeiro valor da IA.

Realizar backfills volumosos de Change Data Capture (CDC) no PostgreSQL em ambientes de produção é um desafio complexo, que vai além da simples leitura de dados históricos. As falhas geralmente decorrem de gargalos como retenção de WAL, confirmações de slot tardias, transações de longa duração e snapshots obsoletos, que disputam recursos com as operações em tempo real. Para mitigar esses riscos, projetos robustos adotam estratégias como o consumo em blocos do WAL, checkpointing progressivo, reconciliação de dados via watermarks e fences, e o ajuste dinâmico do tamanho dos blocos de acordo com a taxa de escrita.

Análises aprofundadas em quatro estudos de caso de uso do Apache Spark em produção revelaram oportunidades significativas para otimização, resultando em reduções notáveis no tempo de execução, consumo de recursos computacionais, volume de operações no S3 e custos totais. A chave para esses ganhos foi a identificação de desperdícios ocultos que, muitas vezes, não são detectados por métricas tradicionais de CPU e memória, mas que foram expostos por um processo detalhado de tracing em toda a stack de dados.

Enquanto soluções como o dbt revolucionam a engenharia de dados, convertendo análises antes frágeis e sem documentação em sistemas reprodutíveis e robustos, a evolução da IA frequentemente subestima os desafios inerentes aos ambientes corporativos. Esse contraste evidencia a importância de ferramentas que assegurem a clareza e a sustentabilidade dos processos de dados, evitando abordagens que desconsideram a complexidade do dia a dia nas empresas.

O Jetpack apresenta uma abordagem inovadora para otimizar sistemas de consenso distribuído, implementando um caminho de commit rápido e portátil de 1-RTT. Essa técnica visa reduzir significativamente a latência em até 60% para cargas de trabalho intensivas em escrita. Contudo, a otimização não vem sem desafios: ela introduz um custo de trabalho redundante, pode atrasar a execução e exige um processo de recuperação meticuloso para garantir a segurança dos dados durante transições de líder. A proposta será detalhada na OSDI '26.

Receba as melhores notícias de tech

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser
CEVIU News - CEVIU Dados - 15 de setembro de 2026 | CEVIU