CEVIU Dados
Todas as notícias

CEVIU Dados

Big data, ciência de dados e engenharia de dados

691 notícias

A engenharia de contexto tornou-se rapidamente central no design de agentes de IA. Padrões amadurecidos, como divulgação progressiva, compressão em janela deslizante com sumarização, roteamento de contexto preciso, geração aumentada por recuperação agentic, e gerenciamento rigoroso de ferramentas são amplamente adotados nas plataformas. As Habilidades de Agente da Anthropic e o protocolo MCP estabeleceram padrões para workflows impulsionados por LLMs, mas persistem compromissos em relação ao custo de tokens, latência e manutenibilidade. Equipes de dados devem auditar o consumo de tokens e implementar compressão e roteamento híbridos desde cedo para garantir a confiabilidade e eficiência de custo dos agentes.

A Datadog enfrentou um problema surpreendente de desempenho do Postgres ao limpar milhões de hosts temporários: um simples upsert para atualizar o timestamp de "última visualização" dobrou as gravações em disco e quadruplicou as sincronizações WAL. A causa foi ON CONFLICT DO UPDATE sempre adquirir um bloqueio de linha e gravar no WAL, mesmo quando nenhum dado realmente muda. A solução é evitar bloqueios em upserts sem operação.

A Volga agora é um motor totalmente baseado em Rust para IA/ML em tempo real, substituindo o núcleo anterior Python+Ray para obter um runtime mais simples e de maior desempenho, além de melhor controle sobre execução e estado. Ela unifica streaming, processamento em lote e computing em tempo de requisição em um sistema independente, eliminando a integração usual entre Flink, Spark, Redis e serviços personalizados, mantendo um estado correto em ponto único no motor. Os principais componentes são Apache DataFusion para pipelines SQL, Apache Arrow para semântica de execução e SlateDB para estado com suporte S3.

A Expedia desenvolveu o Trino Gateway para resolver a crescente complexidade de gerir dezenas de clusters especializados à medida que o volume de consultas, a simultaneidade e a diversidade de cargas de trabalho aumentavam. Em vez de forçar os usuários a se conectar a diferentes endpoints, o gateway oferece uma URL de conexão unificada que direciona automaticamente as consultas ao melhor cluster com base em regras inteligentes.

Avanços impulsionados por IA estão desafiando fundamentalmente o modelo do Stack de Dados Moderno, com LLMs agora capazes de gerar SQL de alta qualidade, automatizar pipelines ETL e criar visualizações de dados sofisticadas, reduzindo drasticamente a escrita manual de consultas e o uso de ferramentas tradicionais de BI. Fornecedores de data warehouse enfrentam pressões de comoditização, enquanto a consolidação e integração no stack aceleram. O paradigma emergente de plataforma de dados provavelmente será um enxame de agentes para gestão de dados, apoiado por um motor de consulta impulsionando a análise.

O Databricks está entrando no espaço da camada semântica com o Metric Views, uma forma de definir métricas de negócios centralmente no Unity Catalog usando tabelas Delta. No entanto, ainda é bastante limitado comparado às camadas semânticas maduras, suportando apenas agregações simples e carecendo de lógica de negócios complexa, métricas calculadas com dependências e modelagem dimensional avançada.

Confiar apenas em um banco de dados vetorial não é mais suficiente para aplicações de IA em produção, especialmente em sistemas RAG e baseados em agentes. Uma camada de dados completa para IA requer cinco componentes integrados: armazenamento vetorial, metadados e filtragem, camada de grafos, cache e governança e observabilidade, tornando essencial arquiteturas híbridas (vetorial + grafo + relacional) para alcançar melhor precisão, menor custo e prontidão real para produção.

O Apache Iceberg lançou o iceberg-rust 0.9.0, introduzindo uma arquitetura de armazenamento baseada em traits que dissocia a biblioteca de backends de armazenamento específicos, facilitando a integração e a extensão. Esta versão apresenta melhorias significativas no desempenho de leituras do Arrow, suporte expandido a DataFusion e upgrades no manuseio de números decimais para precisão de 38 dígitos com o crate fastnum.

Monitorar anomalias de volume de dados na camada de data warehouse, ao invés de apenas na origem, é crucial quando as fontes são diversas, os modos de falha são silenciosos e os fluxos em tempo real carecem de limites de lote. Essa abordagem centralizada cria um ponto unificado de detecção e comunicação, conectando produtores a montante e consumidores a jusante, oferecendo sinais acionáveis de saúde dos dados. A introdução de uma camada de supressão para anomalias conhecidas e específicas do contexto minimiza o cansaço de alertas sem incorrer em dívida técnica.

O Discord doou seu poderoso motor de regras interno, Osprey, agora pronto para produção e melhorado pela comunidade, para o ROOST. Ele processa eventos de plataforma em tempo real, como logins e mensagens, para detectar ameaças instantaneamente. Avalia milhares de regras, sinaliza atividades suspeitas e apoia investigações com serviços de parceiros como Musubi e Zentropi.

Mover sistemas de IA autônoma de demonstrações impressionantes para uma produção confiável continua sendo mais difícil do que com o aprendizado de máquina tradicional. Os desafios são ampliados em áreas como coordenação, visibilidade, economia, testes e controle. Saídas probabilísticas dificultam testes determinísticos. LLM-as-judge e simulações ajudam, mas ainda necessitam de supervisão humana intensa e carecem de padronização.

O crescimento dos hyperscalers está próximo de seus limites de fluxo de caixa, incapaz de acompanhar o ritmo da demanda, tornando as neoclouds indispensáveis em um mercado estruturalmente limitado por oferta e geografia. A demanda por compute de IA fez com que o backlog do Azure aumentasse 1.150%, atingindo US$ 625 bilhões. Mesmo a Microsoft não consegue se autossuprir, promovendo parcerias rápidas com neoclouds como CoreWeave e Crusoe, cujos compromissos com GPUs já excedem US$ 131 bilhões. Grandes laboratórios de IA, como OpenAI e Anthropic, agora diversificam para além de dependências de uma única nuvem, enquanto as neoclouds fornecem 10% a 20% do capex de IA.

Tansu.io apresenta um broker de mensagens compatível com Kafka e sem estado, onde a durabilidade é totalmente transferida para armazenamento externo, reduzindo radicalmente a necessidade de memória do broker para cerca de 20MB e permitindo implantações de escala zero em 10ms. Com backends de armazenamento plugáveis (S3, SQLite ou Postgres direto), o Tansu simplifica pipelines de streaming ao escrever registros validados (Avro, JSON ou Protobuf) diretamente em formatos de tabela abertos, como Iceberg e Delta Lake, e elimina o outbox transacional. Código disponível no GitHub. ️

O Registro do Apache Airflow oferece um catálogo centralizado e pesquisável com 98 providers e mais de 1.600 módulos, incluindo operadores, hooks e módulos específicos para Amazon. Destaques incluem busca instantânea, páginas de providers com comandos de instalação com um clique, builders de conexão integrados gerando formatos URI, JSON ou Env Var, além de uma JSON API para integração programática com ferramentas e IDEs. Isso agiliza a descoberta, configuração e automação de módulos.

As cargas de trabalho de IA estão forçando uma convergência de domínios anteriormente separados (análises em tempo real, data warehousing e observability) em uma única plataforma de dados de alta concorrência e baixa latência. Isso ocorre porque sistemas antigos orientados por batch não conseguem lidar com rajadas de consultas interativas, grandes volumes de dados não amostrados ou atualizar em tempo real sem falhas.

A equipe de Analytics Data Warehouse da Grab implementou um sistema de IA multiagente capaz de resolver autonomamente até 40% das consultas de usuários repetitivas. Isso liberou centenas de horas de trabalho de engenharia mensalmente entre mais de 1.000 usuários e 15.000 tabelas. Agentes especializados substituem a triagem manual em tarefas que vão desde melhorias de código até investigações de linhagem de dados. Múltiplas camadas de proteção e um processo com supervisão humana garantem segurança, qualidade de dados e confiança dos usuários. ️

Outras categorias