CEVIU Logo

CEVIU News

As melhores notícias de tecnologia, curadas diariamente para quem vive tech.

222 notícias encontradas

Clustering de texto não estruturado ajuda a descobrir automaticamente tópicos em documentos sem rótulo ao combinar embeddings do sentence-transformers com UMAP para redução de dimensionalidade e HDBSCAN para clustering baseado em densidade. Esse pipeline moderno captura o significado semântico muito melhor do que métodos tradicionais, determina automaticamente o número de clusters e lida bem com ruído e outliers.

A qualidade do data warehouse precisa entrar no ciclo completo de desenvolvimento, e não ficar para a revisão final. As equipes podem impedir que pequenas inconsistências se espalhem para definições compartilhadas, dashboards e lógica de negócio ao antecipar as verificações com revisões de modelagem, validação local, CI/CD, revisão assistida por IA, julgamento humano e monitoramento.

A Zalando construiu um client-side load balancer de alta performance, in-process, para a Product Read API, capaz de lidar com mais de um milhão de requisições por segundo de tráfego interno de fan-out, substituindo o shared edge ingress Skipper para requisições em lote. A equipe implementou consistent hashing compatível com o Skipper, descoberta baseada em watch do Kubernetes, N-ring fade-in para subir capacidade de forma suave e routing ciente de AZ.

A Zepto construiu um Dual Sequence ReRanker para personalização em tempo real que combina o histórico de longo prazo do usuário com o comportamento atual da sessão, usando transformer encoders separados para a sequência de histórico e a sequência da sessão. O modelo também usa target-aware pooling, que reconstrói dinamicamente o perfil do usuário para cada item candidato, além de uma learned fusion gate e sinais em tempo real, como contadores de tendência e contexto de calendário.

Agentes de codificação de longa duração funcionam melhor quando estão ancorados em contexto estruturado e artefatos persistentes: pesquisa no repositório, bases de conhecimento, planos, arquivos de progresso, relatórios de verificação e notas de revisão. O Agentic Orchestrator transforma essas passagens de bastão em um workflow em máquina de estados, dando aos agentes dados compartilhados suficientes para encarar tarefas maiores sem perder coerência.

CEVIU Dados🚀 Lançamento

Na edição de 2026 do Data + AI Summit, a Databricks anunciou duas inovações-chave para simplificar arquiteturas de dados: o Lakehouse//RT, voltado para aplicações e dashboards em tempo real diretamente sobre o lakehouse, e o LTAP, modelo que integra cargas transacionais e analíticas numa única cópia governada de dados. A proposta elimina a necessidade de bancos de dados separados, CDC, ETL e camadas intermediárias de processamento.

A Nordnet implementou um sistema de sinalização visual em tempo real no Looker, com cores verde, amarelo e vermelho, para indicar a confiabilidade dos dados exibidos em dashboards. A solução detecta falhas no dbt, interrupções silenciosas, problemas de atualização e anomalias de volume, consolidando alertas recorrentes. Com base na linhagem de dados entre dbt e Looker, ela também mostra o impacto potencial de cada problema, tornando a governança mais transparente e acionável.

CEVIU Dados🚀 Lançamento

A AWS entrou na corrida pela camada de contexto com o lançamento do AWS Context, uma stack que constrói e atualiza dinamicamente um knowledge graph a partir de dados corporativos, regras e conhecimento de domínio, sem depender de curadoria manual. A solução integra S3 Annotations e novos recursos de skill no Glue Data Catalog, com controle de acesso via IAM e Lake Formation. Metadados são armazenados em formatos abertos (Iceberg) no S3 Tables e expostos via Athena, Redshift, Spark e MCP.

O ClickHouse comemora uma década desde sua liberação como software livre. O que começou como um projeto interno para análise web evoluiu para uma das principais bases de dados analíticas do mundo, otimizada para cargas pesadas, consultas em tempo real e escalabilidade horizontal. A contribuição contínua da comunidade foi essencial para seu amadurecimento técnico e adoção em ambientes críticos de dados.

Em 2026, o engenheiro de analytics deixa de ser apenas executor de modelos para assumir papéis estratégicos: projetista de sistemas, responsável pela governança de dados e provedor de contexto para IA. Com ferramentas automatizando SQL, testes e estrutura base do dbt, a atuação se concentra em arquitetura robusta, qualidade de dados e alinhamento com aplicações de IA, já usadas por 72% dos profissionais com apoio de codificação assistida.

A Lyft desenvolveu uma Metric Semantic Layer interna para padronizar definições de métricas e eliminar discrepâncias entre equipes. A governança se baseia em Golden Metrics, com responsabilidade compartilhada entre donos de negócios e operações, versionamento rigoroso, APIs Python, interfaces de autoatendimento, catálogo no Amundsen e agentes de IA. A solução atua como única fonte da verdade, garantindo que atualizações na lógica de negócios sejam propagadas automaticamente por todo o ecossistema de dados.

O Genie Ops destaca que, embora pipelines com capacidade de auto-recuperação sejam tecnicamente viáveis, sete barreiras estruturais persistem: gestão insegura de credenciais, orquestração deficiente de eventos, controle fragmentado de agentes, ausência de padrões robustos de versionamento (como cloning, rollback e sandboxing) e lacunas em governança, contexto operacional e interoperabilidade. Sem normas claras e adotadas coletivamente, a infraestrutura de dados tende à complexidade excessiva e à baixa manutenibilidade.

CEVIU Dados🚀 Lançamento

O DuckDB 1.5.4, lançado oficialmente, é uma atualização de manutenção que corrige bugs, aprimora a segurança e otimiza o desempenho em operações-chave: manipulação de colunas VARIANT, comandos MERGE INTO, processamento de JSON e Parquet, integração com Apache Arrow, compactação gzip e comportamento da CLI. A versão mantém a filosofia leve e rápida do banco de dados analítico embutido, priorizando estabilidade e eficiência para fluxos de dados modernos.

A Zepto aprimorou significativamente a ingestão de dados no ClickHouse ao reescrever componentes críticos do conector open-source do Kafka Connect. A otimização elevou o throughput em 45%, eliminou pausas severas de Garbage Collection e implementou um sistema de batching mais inteligente. A equipe ainda contribuiu com duas correções importantes para o repositório upstream do projeto.

Projetos dbt integrados a IA exigem documentação rigorosa: o repositório deve explicar explicitamente como os modelos interagem com ferramentas de IA, quais convenções de nomenclatura e versionamento são usadas, e quais frameworks ou LLMs são recomendados para geração de SQL, testes ou documentação automatizada, tudo isso para garantir manutenibilidade, governança e adoção em times de dados.

CEVIU Dados🚀 Lançamento

A OpenAI introduziu uma técnica pré-release que replica, com dados anonimizados, prefixos reais de conversas de usuários para testar modelos candidatos. Ao processar essas interações simuladas, a abordagem permite antecipar comportamentos em produção com maior fidelidade, gerando estimativas mais precisas de taxas de respostas indesejadas do que avaliações tradicionais.

CEVIU Dados🚀 Lançamento

O Instacart substituiu seu antigo sistema de retrieval de anúncios, baseado em BERT e scoring individualizado por ID de produto, por uma abordagem generativa que opera token por token. A nova arquitetura usa os 'Instacart Semantic IDs', permitindo geração direta de recomendações mais contextualizadas e eficientes, com ganhos significativos em precisão e escalabilidade. A mudança reflete uma migração estratégica de modelos discriminativos para gerativos no core do sistema de anúncios.