CEVIU Dados
Todas as notícias

CEVIU Dados

Big data, ciência de dados e engenharia de dados

691 notícias

A Fivetran acelerou significativamente o SQLGlot, o popular parser, transpiler e otimizador de SQL em Python puro, ao compilá-lo com mypyc. O mypyc é uma ferramenta que transforma código Python bem tipado em extensões C rápidas. A Fivetran distribui a versão compilada como um pacote opcional, proporcionando um parsing aproximadamente 5x mais rápido, geração de SQL cerca de 2.5x mais veloz e otimização 2-2.5x mais rápida. A versão original em Python puro é mantida como padrão para garantir máxima compatibilidade.

O DuckDB é rápido porque executa in-process, evitando a movimentação de dados entre servidor e cliente. Ele combina armazenamento colunar, otimização de queries, predicate pushdown, execução vetorizada e row-group pruning para escanear apenas os dados necessários. Este artigo detalha como o DuckDB transforma SQL em um plano executável e explora as razões pelas quais seu modelo de armazenamento e leitura de arquivos Parquet proporciona uma experiência de análise de dados excepcionalmente rápida em uma única máquina.

Ao integrar LLMs com Apache Kafka, utilize o Kafka estritamente como um backbone de eventos durável e mantenha toda a inference do modelo fora do broker. Adote um dos três principais padrões de inference (RPC externo, modelos embarcados como ONNX/TFLite ou sidecar), e siga as melhores práticas para o design de tópicos (raw-events → enriched-context → model-outputs), replayability, dead-letter queues, idempotency, e considerações de custo, latency e governança.

A Faire reconstruiu seu stack de ranqueamento de busca, migrando do XGBoost para deep learning, a fim de otimizar melhor objetivos concorrentes como relevância, atualidade, descoberta de marcas e consistência entre superfícies. Essa migração exigiu a reestruturação dos pipelines de dados, da observability e do serviço em produção, incluindo uma infraestrutura customizada baseada em Docker, embeddings em memória compartilhada e sandboxing de CPU. Essas mudanças reduziram a latência de startup de 20-30 minutos para apenas alguns minutos. O novo stack resultou em ganhos mensuráveis, como um aumento de aproximadamente 2% no volume de pedidos na Busca de Produtos.

Plataformas de dados em nuvem como Snowflake, BigQuery, Redshift e Databricks tornaram o ELT o padrão, pois é mais simples, mais rápido para iterar e permite que as equipes utilizem o poder computacional escalável do data warehouse para as transformações.

Apache Fluss é um "Kafka indexável" que combina ingestão de streaming horizontalmente escalável com armazenamento colunar, tabelas com chave primária, CDC e tiering opcional para S3 ou formatos de lakehouse como Iceberg e Paimon. Ele promete simplificar significativamente as cargas de trabalho de streaming com estado e lookup. Em produção no EKS, a integração com Flink requer a resolução de várias questões, como a ausência de JARs de conector, problemas de credencial/delegation-token do S3 e dependências adicionais. Apesar de seu potencial, o uso em produção da versão 0.9 ainda exige ajustes operacionais cuidadosos.

O Polars oferece suporte robusto e integrado para a evolução de schema, lidando com alterações como a adição ou remoção de colunas, desvios de tipo (type drifts) e modificações que podem causar quebras (breaking changes). Para garantir que os pipelines não sejam interrompidos por mudanças nos schemas a montante (upstream), é possível configurar o Polars, dependendo do formato de dados, utilizando parâmetros específicos como `missing_columns="insert"`, `schema_mode="merge"`, `ScanCastOptions` e a concatenação `diagonal_relaxed`.

A maioria dos sistemas RAG falha em produção porque as equipes implementam de forma rígida um vector DB, um modelo de embedding e uma estratégia de chunking sem observability ou avaliações repetíveis. O Weave CLI soluciona esse problema ao unificar 11 databases de vector, 5 provedores de embedding e agentes intercambiáveis em uma única interface configurável. Além disso, OpenTelemetry e Opik tracing são incorporados desde o primeiro dia.

A Meta desenvolveu um "Segundo Cérebro" de IA interno para auxiliar seus profissionais do conhecimento a encontrar, sintetizar e raciocinar rapidamente sobre grandes volumes de informações e documentos internos da empresa. O sistema combina Geração Aumentada por Recuperação (RAG), busca avançada e capacidades baseadas em agentes, com atenção cuidadosa à privacidade, precisão e controles de nível empresarial.

TurboQuant é um algoritmo de quantization e compressão projetado para caches Key-Value (KV) em grandes modelos de linguagem e sistemas de busca vector. Ele emprega o PolarQuant para inicialmente mapear vectors em coordenadas polares. Em seguida, aplica o QJL (Quantized Johnson-Lindenstrauss), que realiza uma correção mínima de 1 bit para eliminar vieses ocultos. Este processo permite uma compressão de até aproximadamente 3 bits por valor, com perda de precisão praticamente inexistente.

A IA está se tornando útil para a engenharia de analytics não substituindo o julgamento humano, mas eliminando o trabalho de auditoria repetitivo em torno da validação. O melhor padrão são os workflows assistidos por agentes, com foco em evidências, onde a IA executa verificações, investiga mudanças, demonstra seu trabalho, e os humanos ainda decidem o que é aceitável.

A Grab está operacionalizando a certificação de data mesh por meio de um grafo de metadados event-driven, construído sobre o DataHub. Essa abordagem é suportada por eventos de metadados baseados em Kafka, que alimentam o DataHub Actions para certificação contínua. Para os fluxos de trabalho de validação, a empresa utiliza o Temporal, enquanto eventos de conclusão de pipeline do Airflow e Lighthouse são empregados para acionar verificações de qualidade automatizadas. A premissa fundamental é que a confiança não é atribuída manualmente, mas sim calculada a partir de dados em tempo real sobre propriedade, linhagem, contratos, SLAs e a saúde dos testes. Além disso, as regras de contrato são diretamente vinculadas a endpoints de saúde concretos, garantindo uma validação contínua e automatizada.

O Pinterest desenvolveu o Feature Trimmer para remover dinamicamente features de baixo valor ou redundantes de requisições de treinamento e inference de ML em larga escala. Essa ferramenta reduz drasticamente o uso e o custo da largura de banda da rede, enquanto mantém o desempenho do modelo. O Feature Trimmer combina uma análise offline de importância de features com uma lógica de trimming online, resultando em uma redução substancial da largura de banda da rede e melhoria na latency do lado do cliente.

Frequentemente, o aconselhamento em engenharia de dados falha porque é concebido para um de cinco modelos operacionais distintos: equipes de analytics em estilo startup, ambientes corporativos legados, sistemas de produto/dados críticos para resultados, negócios regulados ou organizações de plataforma/data mesh. Cada um desses modelos possui prioridades diferentes, como velocidade, estabilidade, impacto, auditabilidade ou adoção , , e práticas que são consideradas "melhores" em um contexto podem se mostrar perigosas em outro. É crucial classificar seu ambiente antes de aplicar qualquer orientação, garantindo que as práticas de arquitetura, governança e entrega estejam alinhadas às restrições reais de cada cenário.

A Neo4j lançou uma primeira leva de Agent Skills para manter agentes de codificação atualizados com o Cypher 25 e a sintaxe recente alinhada ao GQL, incluindo SHORTEST 3, REPEATABLE ELEMENTS, quantified path patterns e path projections.

As Materialized Tables no Apache Flink permitem que os usuários definam uma tabela diretamente com sua query de população, fazendo o embedding tanto do schema quanto da lógica de atualização contínua ou agendada dentro do catálogo. Isso simplifica os pipelines de ETL ao gerenciar automaticamente o ciclo de vida do job, a evolução do schema e as atualizações.

O Pinterest desenvolveu um modelo de retrieval two-tower dedicado para gerar candidatos a anúncios de compras mais eficazes, otimizados para conversões offsite. Essa abordagem supera os sinais tradicionais baseados em cliques e engajamento, que, embora abundantes, possuem baixa correlação com a intenção real de compra. O sistema utiliza uma arquitetura unificada multi-tarefa, incorporando camadas cruzadas paralelas DCN v2 e MLP, e emprega técnicas de treinamento inovadoras para lidar com dados de conversão esparsos e ruidosos, juntamente com uma função de perda aplicada em nível de anunciante.

A Vinted reconstruiu seu sistema de autocompletar busca, transicionando de sugestões estáticas e genéricas para uma abordagem híbrida. Esta nova abordagem combina um robusto modelo de pontuação heurística com um modelo Learning-to-Rank (LTR). As sugestões são pontuadas offline utilizando popularidade, taxa de sell-through e sinais de uso, e indexadas com técnicas inteligentes de prefix e fuzzy matching. Posteriormente, um modelo LightGBM é aplicado em tempo real, incorporando o comportamento e o contexto do usuário para re-rankear os resultados.

Skipper é um engine de workflow leve e embarcado, projetado para oferecer execução durável e confiável para processos de negócio de longa duração, como sinistros de seguro e pagamentos. Em vez de depender de ferramentas de orquestração externas ou filas, o Skipper utiliza uma abordagem simples baseada em anotações para persistir o estado no banco de dados existente do serviço e alcança durabilidade por meio de um replay determinístico.

Outras categorias