CEVIU Dados
Todas as notícias

CEVIU Dados

Big data, ciência de dados e engenharia de dados

691 notícias

Agentes de codificação com IA aliviam tarefas repetitivas, mas não resolvem os desafios centrais do desenvolvimento: julgamento de arquitetura, controle de escopo, testes robustos e manutenibilidade. Ao reduzir a complexidade acidental, podem, paradoxalmente, gerar dívida técnica, desvios arquiteturais e bases de código infladas, e rápido. A vantagem competitiva continua com engenheiros especializados, capazes de orientar modelos, estabelecer guardrails e garantir sistemas prontos para produção.

CEVIU Dados🚀 Lançamento

A Databricks anunciou o Omnigent, um meta-harness open-source que integra agentes como Claude Code, Codex, Pi e soluções personalizadas sob uma camada unificada. A ferramenta permite compor agentes de forma ágil, aplicar controles de segurança e custos, compartilhar sessões em tempo real e garantir a portabilidade de workflows à medida que novas ferramentas surgem, tudo voltado para equipes de dados e engenharia de IA.

O Feldera processa fluxos de dados como visões SQL incrementais, com base no DBSP: em vez de recalcular joins e agregações a cada nova entrada, ele propaga apenas os deltas, inserções, deleções e atualizações, representados como mudanças em Z-sets. Assim, só as linhas efetivamente afetadas são modificadas. O resultado é uma semântica SQL consistente em ambientes contínuos, com menor uso de CPU, redução da pressão sobre memória e latência previsível.

CEVIU Dados🚀 Lançamento

A Linux Foundation anunciou o projeto OpenSharing, que amplia o protocolo Delta Sharing, agora sob sua governança após transferência da Databricks. O novo padrão suporta não só dados estruturados, mas também modelos de IA, habilidades de agentes e dados não estruturados, com APIs abertas para descoberta, autorização e acesso. Ele integra destinatários do Delta Sharing e clientes de catálogos Apache Iceberg/REST, visando substituir marketplaces proprietários por uma única camada interoperável para distribuição de ativos de IA empresarial.

CEVIU Dados🚀 Lançamento

O Google Research apresentou os testes de Kernel de f-Divergência Regularizada, um novo framework para auditoria de machine unlearning que detecta vazamentos de privacidade com precisão superior aos tradicionais testes de duas amostras. A abordagem melhora a confiabilidade na verificação de se um modelo realmente esqueceu dados sensíveis após solicitação de exclusão, requisito crítico para conformidade com regulamentações como LGPD e GDPR.

O LinkedIn desenvolveu o MUSE (Member Understanding Semantic Embeddings), um sistema de busca semântica para seu Hiring Assistant. Baseado em um modelo de embedding Matryoshka dual-tower, ele é treinado com milhões de rótulos de alta qualidade gerados por um LLM Teacher alinhado às políticas do produto. O MUSE combina retrieval via embeddings com um ranker downstream otimizado para engajamento, solução crítica para agentes de IA que operam em larga escala com dados de membros.

O padrão DataAgent da Capital One reduziu o tempo de análise de dormência em nuvem para cerca de 350 tipos de recursos na AWS, Azure e GCP de 6 a 9 meses para apenas 10 dias. A abordagem combina dados de ativos, Spark SQL gerado por IA, pontuação de confiança, verificações de falsos positivos e validação humana para identificar oportunidades de economia com alta confiabilidade.

CEVIU Dados🚀 Lançamento

O Claude Fable 5 representa um avanço significativo para análises de dados complexas, superando modelos de fronteira recentes em cerca de 10-15% nas avaliações da Hex. Ele se destaca em tarefas longas e desestruturadas que exigem julgamento, suposições claras e a verificação cruzada de modelos semânticos com dados brutos.

O Apache Gravitino permite governar tabelas Iceberg e datasets multimodais Lance através de uma única camada de metadados, modelo RBAC e superfície de auditoria. Enquanto o Iceberg realiza commits via catálogo, o Lance utiliza um fluxo de armazenamento de objetos em duas etapas, apresentando desafios relacionados a reescritas de configuração, jars, diferenciação de maiúsculas em enums e divergências no cliente.

O Airbnb evoluiu sua arquitetura de dados offline para suportar um ecossistema multiplataforma utilizando um framework de modelagem flexível que equilibra consistência compartilhada com necessidades específicas de cada domínio. A estratégia baseia-se em três princípios fundamentais: ausência de modelos híbridos, padronização na nomenclatura de identificadores e namespaces claros. Essa abordagem permite que as equipes mantenham a distinção entre modelos específicos de produtos e modelos monolíticos de uso transversal.

CEVIU Dados🚀 Lançamento

O Streamling é um runtime de streaming open-source baseado em Rust, Arrow e DataFusion, focado em workloads transacionais em vez de analytics pesados. Ele executa majoritariamente pipelines stateless de nó único, oferecendo suporte a Kafka, Postgres, ClickHouse, enriquecimento HTTP, transformações via TypeScript/WASM, plugins, checkpointing e entrega exactly-once.

O Zero Copy no Salesforce Data 360 evoluiu de Query Federation para Iceberg File Federation para suportar cargas de trabalho de IA em dados corporativos distribuídos, sem a necessidade de centralização. A nova arquitetura reduz o overhead de compute entre sistemas e preserva a governança por meio de acesso baseado em catálogo temporário, atendendo à demanda por IA em tempo real em grandes plataformas de dados.

Durante a construção de seu pipeline de faturamento baseado em uso, a Gorgias enfrentou janelas sobrepostas e agregações incorretas em reprocessamentos históricos. O problema foi causado por reparticionamento interno e comportamento desigual de operadores, que comprometeram as garantias de event time. A equipe mitigou essas falhas alinhando chaves entre as etapas do pipeline e aplicando atrasos extras condicionais apenas durante os replays.

CEVIU Dados🚀 Lançamento

Datasets de vetores evoluem através de backfills, versões de embedding e cargas de trabalho mistas, indo além das colunas de vetores. O Loon, que fundamenta o Milvus 3.0 beta e o Zilliz Vector Lakebase, utiliza formatos de arquivo híbridos, alignment de row-ID e manifestos versionados. Isso permite que escalares, vetores e referências de objetos sejam atualizados de forma independente com menos necessidade de reescrita.

Em lakehouses com alta frequência de atualizações, os metadados tornam-se um sistema de alta mutação. A tabela de metadados Merge-On-Read do Apache Hudi lida com essa demanda por meio de escritas do tipo append-first e compactação diferida, o que reduz o custo de escrita e permite um indexamento mais eficiente e escalável do que os designs baseados em Copy-On-Write.

O query engine de séries temporais do QuestDB opera externamente como se processasse uma tupla por vez, mas internamente combina execução vetorizada, kernels SIMD em C++, processamento em batch via Java, filtragem JIT e paralelismo baseado em frames. Pequenas alterações em comandos SQL podem alterar os caminhos de execução, impactando diretamente o desempenho de operações como group-by, filtragem e agregação.

Wes McKinney alerta: vibe coding é perigoso quando envolve prompts one-shot, falta de revisão e deploy às cegas. A alternativa está na engenharia com agentes, desde que haja envolvimento humano profundo em especificações, arquitetura, testes e revisão. O workflow proposto usa IA como acelerador, preservando o julgamento de engenharia com ferramentas como Superpowers e Roborev, rastreamento de tokens e práticas rigorosas de manutenção para garantir responsabilidade dos agentes ao longo do tempo.

Materialized views com suporte a join aceleram o BI baseado em star-schema ao manter junções entre fatos e dimensões disponíveis para reescrita de consulta. Em contrapartida, materializações de tabela única frequentemente ignoram atributos de agrupamento de dashboards. Plataformas como StarRocks, BigQuery, Redshift e Oracle oferecem suporte direto a essa funcionalidade, enquanto o Databricks aposta em Metric Views experimentais e o Snowflake mantém a capacidade fragmentada entre materialized views e Dynamic Tables.

Outras categorias