CEVIU Logo

CEVIU News

As melhores notícias de tecnologia, curadas diariamente para quem vive tech.

222 notícias encontradas

CEVIU Dados🚀 Lançamento

A Databricks anunciou o Omnigent, um meta-harness open-source que integra agentes como Claude Code, Codex, Pi e soluções personalizadas sob uma camada unificada. A ferramenta permite compor agentes de forma ágil, aplicar controles de segurança e custos, compartilhar sessões em tempo real e garantir a portabilidade de workflows à medida que novas ferramentas surgem, tudo voltado para equipes de dados e engenharia de IA.

O LinkedIn desenvolveu o MUSE (Member Understanding Semantic Embeddings), um sistema de busca semântica para seu Hiring Assistant. Baseado em um modelo de embedding Matryoshka dual-tower, ele é treinado com milhões de rótulos de alta qualidade gerados por um LLM Teacher alinhado às políticas do produto. O MUSE combina retrieval via embeddings com um ranker downstream otimizado para engajamento, solução crítica para agentes de IA que operam em larga escala com dados de membros.

O Spotify lançou o Vedder, assistente de dados baseado em IA usado por mais de 2.100 usuários em 177 clusters, superando soluções RAG puramente esquemáticas em mais de 70.000 datasets. Cada cluster é cuidadosamente curado por especialistas de domínio, que fornecem datasets, pares validados de pergunta-SQL e documentação de negócio. Apenas 12,5% dos pares minerados foram aprovados; o sistema usa uma pontuação de saúde para monitorar drift, validade, cobertura e reprodutibilidade, assegurando confiabilidade contínua do contexto.

O Airbnb evoluiu sua arquitetura de dados offline para suportar um ecossistema multiplataforma utilizando um framework de modelagem flexível que equilibra consistência compartilhada com necessidades específicas de cada domínio. A estratégia baseia-se em três princípios fundamentais: ausência de modelos híbridos, padronização na nomenclatura de identificadores e namespaces claros. Essa abordagem permite que as equipes mantenham a distinção entre modelos específicos de produtos e modelos monolíticos de uso transversal.

CEVIU Dados🚀 Lançamento

O Claude Fable 5 representa um avanço significativo para análises de dados complexas, superando modelos de fronteira recentes em cerca de 10-15% nas avaliações da Hex. Ele se destaca em tarefas longas e desestruturadas que exigem julgamento, suposições claras e a verificação cruzada de modelos semânticos com dados brutos.

CEVIU Dados🚀 Lançamento

O Streamling é um runtime de streaming open-source baseado em Rust, Arrow e DataFusion, focado em workloads transacionais em vez de analytics pesados. Ele executa majoritariamente pipelines stateless de nó único, oferecendo suporte a Kafka, Postgres, ClickHouse, enriquecimento HTTP, transformações via TypeScript/WASM, plugins, checkpointing e entrega exactly-once.

O Zero Copy no Salesforce Data 360 evoluiu de Query Federation para Iceberg File Federation para suportar cargas de trabalho de IA em dados corporativos distribuídos, sem a necessidade de centralização. A nova arquitetura reduz o overhead de compute entre sistemas e preserva a governança por meio de acesso baseado em catálogo temporário, atendendo à demanda por IA em tempo real em grandes plataformas de dados.

Em lakehouses com alta frequência de atualizações, os metadados tornam-se um sistema de alta mutação. A tabela de metadados Merge-On-Read do Apache Hudi lida com essa demanda por meio de escritas do tipo append-first e compactação diferida, o que reduz o custo de escrita e permite um indexamento mais eficiente e escalável do que os designs baseados em Copy-On-Write.

CEVIU Dados🚀 Lançamento

Datasets de vetores evoluem através de backfills, versões de embedding e cargas de trabalho mistas, indo além das colunas de vetores. O Loon, que fundamenta o Milvus 3.0 beta e o Zilliz Vector Lakebase, utiliza formatos de arquivo híbridos, alignment de row-ID e manifestos versionados. Isso permite que escalares, vetores e referências de objetos sejam atualizados de forma independente com menos necessidade de reescrita.

Durante a construção de seu pipeline de faturamento baseado em uso, a Gorgias enfrentou janelas sobrepostas e agregações incorretas em reprocessamentos históricos. O problema foi causado por reparticionamento interno e comportamento desigual de operadores, que comprometeram as garantias de event time. A equipe mitigou essas falhas alinhando chaves entre as etapas do pipeline e aplicando atrasos extras condicionais apenas durante os replays.

O padrão DataAgent da Capital One reduziu o tempo de análise de dormência em nuvem para cerca de 350 tipos de recursos na AWS, Azure e GCP de 6 a 9 meses para apenas 10 dias. A abordagem combina dados de ativos, Spark SQL gerado por IA, pontuação de confiança, verificações de falsos positivos e validação humana para identificar oportunidades de economia com alta confiabilidade.

O query engine de séries temporais do QuestDB opera externamente como se processasse uma tupla por vez, mas internamente combina execução vetorizada, kernels SIMD em C++, processamento em batch via Java, filtragem JIT e paralelismo baseado em frames. Pequenas alterações em comandos SQL podem alterar os caminhos de execução, impactando diretamente o desempenho de operações como group-by, filtragem e agregação.

O Apache Gravitino permite governar tabelas Iceberg e datasets multimodais Lance através de uma única camada de metadados, modelo RBAC e superfície de auditoria. Enquanto o Iceberg realiza commits via catálogo, o Lance utiliza um fluxo de armazenamento de objetos em duas etapas, apresentando desafios relacionados a reescritas de configuração, jars, diferenciação de maiúsculas em enums e divergências no cliente.

Materialized views com suporte a join aceleram o BI baseado em star-schema ao manter junções entre fatos e dimensões disponíveis para reescrita de consulta. Em contrapartida, materializações de tabela única frequentemente ignoram atributos de agrupamento de dashboards. Plataformas como StarRocks, BigQuery, Redshift e Oracle oferecem suporte direto a essa funcionalidade, enquanto o Databricks aposta em Metric Views experimentais e o Snowflake mantém a capacidade fragmentada entre materialized views e Dynamic Tables.

A Amazon redefine ground truth como processo contínuo, não como dataset estático. No protocolo de verificação de fatos em relatórios complexos gerados por IA, a empresa adota a abordagem 'auditar antes de pontuar': a IA pode contestar labels de benchmark com evidências, e um auditor humano analisa as disputas e atualiza o ground truth quando necessário. O resultado? Precisão do modelo saltando para 90,9%.

Taxonomias organizam conceitos de negócio para humanos; ontologias definem classes, propriedades, restrições e regras formais. No contexto de IA, o vector retrieval performa melhor com textos descritivos de taxonomia, enquanto o raciocínio lógico depende dos axiomas da ontologia. A recomendação é mantê-las conectadas, porém separadas: usuários de negócio curam os conceitos, enquanto os modelos de dados preservam a precisão lógica.

Projetos iniciais com dbt costumam acumular débitos técnicos evitáveis desde cedo. Os erros mais comuns incluem reconstruções completas no CI, ausência de model contracts, desvios silenciosos em modelos incrementais, declarações incorretas de tabelas raw e o compartilhamento indevido de esquemas entre ambientes de dev e produção, armadilhas que comprometem a confiabilidade dos pipelines antes mesmo de escalarem.