CEVIU Dados
Todas as notícias

CEVIU Dados

Big data, ciência de dados e engenharia de dados

691 notícias

Dados prontos para analytics são projetados para humanos: eles são agregados, estáveis e explicáveis para que dashboards possam responder de forma confiável 'o que aconteceu'. Já os dados prontos para IA são construídos para modelos, visando preservar detalhes brutos, contexto, semântica e atualidade, permitindo que os sistemas inferam 'o que deve acontecer em seguida', enquanto a agregação frequentemente destrói o próprio sinal que a IA necessita.

Ontologias empresariais globais frequentemente falham ao forçar diferentes contextos de negócio a compartilhar um único modelo denotacional para termos como cliente, produto e localidade. A abordagem proposta, baseada em interface, visa resolver isso, mantendo ontologias ricas e específicas de domínio dentro de cada limite contextual. Ela expõe apenas projeções sensíveis ao contexto através de mecanismos como reificação RDF 1.2, conotações SHACL 1.2, named graphs e SPARQL transforms. Isso possibilita mudanças de significado auditáveis, uma interoperabilidade mais segura entre domínios e uma mistura prática de descoberta de mundo aberto com raciocínio de mundo fechado na camada de interface.

Um novo método de compressão de KV-cache para LLMs substitui o simples token pruning por uma abordagem mais inteligente: ele identifica contextos de baixo valor, os resume matematicamente e armazena uma versão compacta em vez de simplesmente deletá-los. Em testes, essa técnica resultou em maior precisão e menor uso de memória do que os métodos comuns Top-K ou sliding-window, sugerindo que janelas de contexto mais longas podem ser gerenciadas com maior eficiência.

O ggsql é uma ferramenta, atualmente em fase alpha, que permite aos usuários criar gráficos diretamente em consultas SQL, eliminando a necessidade de alternar para Python ou R. Seu objetivo é tornar a visualização de dados mais rápida, clara e escalável, executando os cálculos dos gráficos no próprio banco de dados, além de facilitar sua geração por ferramentas de IA.

Anthropic, OpenAI e NVIDIA estão enfrentando limites significativos na economia e infraestrutura de IA: problemas de uptime, escassez de capacidade e desenvolvimentos de compute que ficam muito aquém da demanda anunciada. Os serviços Claude da Anthropic registraram um uptime entre 98,79% e 99,25% em 90 dias, enquanto o mercado em geral possui apenas 15,2GW dos 114GW de capacidade prometida para data centers de IA em construção. O aumento dos custos de inference está levando grandes fornecedores como Microsoft e Anthropic a adotar faturamento baseado em token, limites de taxa mais rigorosos e subsídios reduzidos.

A combinação de Cloudflare R2 e R2 Data Catalog torna viável a criação de um Iceberg lake de baixo custo e escalável para uso em notebooks, devido à ausência de taxas de egress, armazenamento compatível com S3 e metadados de catálogo gerenciados para Trino/DuckDB. O desafio da ingestão é abordado no artigo com um proxy HTTP em Rust de aproximadamente 500 linhas de código, que converte dados NDJSON enviados via POST em um único commit atômico no Iceberg.

À medida que a analytics transita da análise centrada em BI e conduzida por humanos para workflows baseados em agentes, a maior disrupção ocorre na camada de 'uso de dados', onde agentes de IA já estão em operação e consultas iniciadas por agentes podem superar as iniciadas por humanos em 12 meses.

O Airbnb desenvolveu um sistema interno de armazenamento de métricas capaz de ingerir aproximadamente 50 milhões de amostras por segundo em cerca de 1,3 bilhão de séries temporais. Isso foi alcançado através da introdução de isolamento rigoroso multi-tenant, incluindo tenancy por serviço e shuffle sharding, além de guardrails em operações de leitura e escrita, visando prevenir que qualquer carga de trabalho individual sobrecarregue o sistema.

A Meta re-arquitetou a busca restrita dos Grupos do Facebook com um stack de retrieval híbrido. Essa nova arquitetura combina a busca lexical de índice invertido Unicorn com um retriever semântico de 12 camadas e 200 milhões de parâmetros, utilizando Faiss ANN sobre embeddings pré-calculados. O sistema inclui pré-processamento de query, rankeamento em nível de features com BM25/TF-IDF mais similaridade de cosseno, e um supermodelo MTML que otimiza conjuntamente cliques, compartilhamentos e comentários. Para escalar a validação, a Meta adicionou um juiz automatizado baseado em Llama 3 no BVT, incluindo uma classe de "parcialmente relevante" para um julgamento mais refinado.

O sistema MIQPS do Pinterest realiza a normalização de URLs, removendo ruídos como parâmetros de rastreamento e diferenças de formatação. O objetivo é mapear diversas variantes de URLs para uma única forma canônica, permitindo que elas sejam agrupadas em categorias de equivalência. O processo inclui salvaguardas para garantir precisão, evitando a fusão inadequada de conteúdos distintos, e opera com ciclos de avaliação contínua para aferir a acurácia e ajustar as regras conforme necessário ao longo do tempo.

Espera-se que a computação quântica seja capaz de quebrar a criptografia de chave pública utilizada atualmente, gerando um risco imediato de "armazene agora, decifre depois" para dados sensíveis. Em resposta, o NIST e o UK NCSC estão acelerando os cronogramas de migração para padrões pós-quânticos com previsão para 2030. Os primeiros padrões, como ML-KEM (Kyber) e ML-DSA (Dilithium), já foram publicados, e o HQC também foi selecionado como parte dessa iniciativa. A Meta revela que já está implementando internamente a criptografia pós-quântica e sugere uma abordagem faseada para outras organizações: inventário criptográfico, priorização dos riscos por aplicação e implantação híbrida para mitigar a exposição enquanto os novos padrões se consolidam.

Mais da metade dos projetos de IA generativa foram abandonados após a Prova de Conceito (POC) no ano passado, em grande parte devido à baixa preparação dos dados. Líderes precisam passar de conjuntos de dados curados para pilotos para pipelines de nível de produção com definições consistentes, metadados mais ricos, linhagem mais robusta e governança automatizada e em tempo real em dados estruturados e não estruturados. Priorização orientada por casos de uso, acesso com privilégio mínimo, auditabilidade e limpeza de dados com human-in-the-loop podem ajudar a preencher essa lacuna.

Data drift refere-se a alterações graduais nas propriedades estatísticas dos dados, como média ou distribuição. Por outro lado, data shift é uma mudança súbita e mais severa, frequentemente causada por alterações em sistemas upstream, atualizações de schema ou eventos de negócio. Distinguir corretamente entre os dois é crucial, pois cada um exige estratégias de alerta distintas para a observabilidade de dados.

O ciclo de release mais recente do Polars aproxima o motor de streaming de um uso padrão, expandindo o suporte para merge joins em streaming, as-of joins, e scans/sinks em streaming através de CSV, NDJSON, IPC e leituras em cloud. A atualização também adiciona roundtrips nativos para Delta Lake e Iceberg, incluindo escritas lazy diretas de volta para Delta e a função sink_iceberg() para pipelines de streaming prontas para commit. Por fim, o Polars Cloud agora inclui profiling de queries com métricas de CPU, RAM, rede e shuffle por estágio.

O desafio central da análise de dados reside frequentemente na divergência semântica, e não no armazenamento. Equipes frequentemente definem o mesmo conceito de negócio de maneiras distintas, uma complexidade exacerbada por agentes de IA que, ao tentar inferir joins e métricas, introduzem inconsistências. Para resolver isso, a Just Eat Takeaway implementou uma stack de solução que trata a governança como um contexto legível por máquina. Isso inclui um glossário de negócios, um catálogo DataHub completo com metadados, informações de propriedade, linhagem e qualidade, e uma camada semântica no Looker onde as métricas são definidas uma única vez e reutilizadas em toda a empresa. O resultado é que tanto humanos quanto a IA consultam e operam com as mesmas definições de dados confiáveis.

O MVCC do PostgreSQL opera armazenando múltiplas versões de cada linha no disco. Cada tupla contém campos `xmin` e `xmax` que determinam sua visibilidade para as transações. Leitores nunca bloqueiam escritores, e escritores nunca bloqueiam leitores. Quando uma linha é atualizada ou deletada, uma nova versão é criada em vez de sobrescrever a antiga, e as versões antigas são posteriormente limpas pelo processo de `vacuum`.

O desempenho do CDC de Postgres para Iceberg depende muito do design do pipeline, especialmente durante a fase de snapshot, e não apenas da marca do conector. Neste benchmark patrocinado, a vantagem de nó único do Supermetal resultou de um caminho de CDC mais rápido, menor overhead de serialização e um comportamento de sink consciente da fase que trata o snapshotting e o CDC em tempo real de forma diferente. Flink e Debezium demandaram mais ajuste e infraestrutura. A lição mais abrangente é que se deve avaliar a arquitetura de snapshot, os parâmetros de ajuste (tuning knobs) e o CDC em estado estável separadamente.

Um contador apenas de crescimento em um armazenamento chave-valor (KV store) com consistência sequencial pode falhar devido a leituras defasadas e atualizações concorrentes que levam à perda de incrementos, mesmo com o uso de compare-and-swap. O artigo detalha os contadores no estilo CRDT, modelos de consistência e a razão pela qual um armazenamento linearizável ou um design baseado em gossip oferece resultados mais confiáveis.

Outras categorias