Claude Code é um poderoso impulsionador de produtividade para prototipagem rápida, iteração e gerenciamento de tarefas repetitivas na engenharia de dados. No entanto, carece de julgamento, confiança e confiabilidade para trabalho de produção não supervisionado devido a saídas que parecem corretas mas estão erradas, perda de dados silenciosa e não determinismo. Assim, Claude Code se posiciona como uma forte ferramenta "companheira" hoje, mas ainda não como um substituto completo.
CEVIU News
As melhores notícias de tecnologia, curadas diariamente para quem vive tech.
18554 notícias encontradas
O Ranking Engineer Agent (REA) da Meta é um agente de IA que acelera o ranking de anúncios gerenciando o ciclo de vida completo de ML com quase nenhuma intervenção humana. O REA utiliza o framework Confucius para acesso persistente a estados e ferramentas, gerando hipóteses de alta qualidade a partir de insights históricos com o ML Research Agent. Este processo segue um Framework de Planejamento de Três Fases (Validação → Combinação → Exploração), operando dentro de orçamentos de compute definidos e lidando autonomamente com erros através de runbooks.
Utilizando o otimizador do DSPy, a Dropbox definiu um objetivo claro para o avaliador de relevância do Dash: minimizar o erro médio quadrático normalizado em relação a avaliações humanas. A equipe incorporou feedback estruturado a partir de lacunas nas avaliações e racionalizações humanas, garantiu a validade de JSON com guardrails e realizou o refinamento iterativo de prompts. Esses avanços possibilitaram de 10 a 100 vezes mais rotulagem sintética pelo mesmo custo e aceleraram a troca de modelos de semanas para 1-2 dias, otimizando significativamente o processo.
A adoção da IA acelerou drasticamente , com agentes agora gerando dados de "trajetória" contextuais e com alta carga de escrita que sobrecarregam bancos de dados operacionais tradicionais e borram as fronteiras entre infraestrutura e feature stores. Implantações reais, como a escalabilidade do PostgreSQL pela OpenAI para 800 milhões de usuários e seguradoras utilizando speech-to-text com 95% de precisão para criação rápida de planos de cuidado, destacam um ROI mensurável . A governança de IA tornou-se urgente, exigindo novas salvaguardas sobre a governança de dados existente, enquanto o hype em torno dos context graphs sinaliza complexidade crescente e desafios de integração semântica ainda não resolvidos .
Modelos de IA não gerenciados criam dívida técnica oculta, representando um risco significativo para a governança de dados e sistemas.
Agentes de IA modernos em ferramentas como Snowflake Cortex, Copilot, Claude e Slack são vulneráveis a ataques de prompt injection que podem contornar as salvaguardas, executar malware e exfiltrar dados sensíveis. Um exemplo real demonstra como um prompt injetado enganou o Cortex para executar código malicioso fora de sua sandbox sem aprovação do usuário, permitindo que atacantes roubem ou destruam dados usando as credenciais da vítima.
O Reddit migrou sua frota Apache Kafka em escala de petabytes, com mais de 500 brokers, do Amazon EC2 para o Kubernetes. A transição foi realizada sem qualquer downtime, perda de dados ou alterações no lado do cliente . Para alcançar isso, a equipe implementou uma fachada DNS para abstração de conexão contínua, dobrou o tamanho do cluster com brokers EC2 de IDs mais altos para liberar IDs mais baixos, e fez um fork do operador Strimzi para permitir uma operação mista EC2-Kubernetes .
A forte dependência de ferramentas de codificação de IA em gigantes da tecnologia como Anthropic, Amazon, Uber e Meta está impulsionando aumentos significativos na produção de código – engenheiros classificados como "power users" de IA produzem 52% mais pull requests. No entanto, essa dependência também está levando a quedas notáveis na qualidade do software, aumento de interrupções e crescimento da dívida técnica. Na Anthropic, mais de 80% do código de produção é gerado por IA, resultando em bugs críticos de UX que afetam milhões de usuários. Similarmente, a Amazon tem observado um aumento nos SEVs (Severity Events) e agora exige revisão sênior para códigos assistidos por IA. Essas tendências destacam a necessidade de uma supervisão arquitetural mais rigorosa, validação de código e maior ênfase na garantia de qualidade.
A Snap migrou suas pipelines de dados para testes A/B do Snapchat, que processam mais de 10 PB de dados por dia, de Apache Spark baseado em CPU para Spark acelerado por GPUs NVIDIA no Google Kubernetes Engine. Essa transição resultou em tempos de execução 4x mais rápidos e uma economia de custo diária de 76% .
O Mistral Forge é uma plataforma destinada a empresas e governos para a criação de modelos de IA personalizados, treinados do zero com seus próprios dados. ️ A empresa o posiciona como uma alternativa mais controlada ao fine-tuning e RAG, oferecendo suporte para treinamento específico de domínio, reinforcement learning e menor dependência de provedores de modelos terceirizados.
A Cursor descreveu como seu modelo Composer aprende a resumir seu próprio contexto durante longas sessões de codificação , comprimindo etapas anteriores em representações mais curtas para estender a memória de trabalho efetiva. Esse comportamento treinado aprimora o desempenho em tarefas de programação multi-etapas, mantendo o uso de tokens gerenciável.
A Microsoft está reorganizando as equipes que trabalham em seu produto de IA carro-chefe, o Copilot . A empresa está unificando as equipes responsáveis pelas ofertas de produtividade do Microsoft 365 Copilot e pela versão para consumidor do Copilot . Jacob Andreou, que lidera produto e crescimento na Microsoft IA, assumirá como vice-presidente executivo do Copilot, sendo responsável por seu design, produto, crescimento e engenharia. Mustafa Suleyman, CEO da Microsoft IA, focará principalmente nos modelos proprietários da empresa e na busca pela superinteligência . A nova estrutura permitirá à companhia oferecer uma experiência mais coerente e competitiva.
A AWS concordou em distribuir produtos da OpenAI para sua base de clientes do setor público. Este movimento sinaliza uma expansão significativa da presença da OpenAI no segmento governamental.
A OpenAI lançou os modelos GPT-5.4 mini e nano, versões menores projetadas para cargas de trabalho de alto volume com maior velocidade e menor custo. O GPT-5.4 mini apresenta melhorias substanciais em relação ao GPT-5 mini e se aproxima do modelo GPT-5.4 maior em alguns benchmarks, enquanto o GPT-5.4 nano é focado em tarefas mais leves, como classificação, extração e ranqueamento.
A OpenAI planeja abrir capital (IPO) até o final do ano, com foco estratégico em transformar o ChatGPT em uma ferramenta de alta produtividade para empresas .
O Unsloth Studio é uma UI web no-code para treinar, executar e exportar modelos abertos. ️ Ele permite que os usuários rodem modelos GGUF e safe tensor localmente em Mac, Windows e Linux, além de executar e treinar modelos de texto, visão, áudio TTS e embedding. O estúdio pode, ainda, criar automaticamente conjuntos de dados a partir de arquivos PDF, CSV, JSON, DOCX e TXT. Um tutorial em vídeo sobre como começar a usar o Unsloth Studio está disponível.
A Nvidia retomou a fabricação de processadores H200 para venda na China. Em dezembro, os EUA anunciaram que permitiriam à Nvidia vender seus processadores H200 no país, desde que 25% das vendas fossem compartilhadas com o governo norte-americano. O CEO da Nvidia, Jensen Huang, declarou no evento GTC da empresa na terça-feira que os sinais de demanda vindos da China se fortaleceram nas últimas semanas e que a cadeia de suprimentos da companhia está sendo ativada. A empresa não comentou sobre o quanto espera faturar com as vendas dos H200 na China, mas o mercado chinês é estimado em dezenas de bilhões de dólares por ano.
A Google DeepMind lançou um artigo que detalha uma taxonomia cognitiva para medir o progresso da IA em direção à AGI, identificando 10 habilidades cognitivas essenciais como percepção, aprendizado e raciocínio. O estudo propõe um protocolo de avaliação de três estágios que compara o desempenho da IA a benchmarks humanos . Além disso, um hackathon no Kaggle, com um prêmio de US$ 200.000, convida pesquisadores a desenvolver avaliações para cinco habilidades ainda pouco exploradas, utilizando a nova plataforma Community Benchmarks .
A estrutura interna da Anthropic trata as "skills" de IA como pastas funcionais, contendo scripts e assets, em vez de texto estático, utilizando o sistema de arquivos para engenharia de contexto. Nove categorias principais foram identificadas, com verificação de produto e seções de "Gotchas" consideradas os componentes de maior alavancagem para aprimorar a confiabilidade da saída. Essa mudança para a "progressive disclosure" permite que os agentes busquem dados específicos e "runbooks" apenas quando necessário, reduzindo o ruído de contexto e as taxas de erro.
Experimentos com o framework de autoresearch demonstram que o design do ambiente e validações rigorosas são mais críticos do que a escolha do modelo para prevenir o drift do agente. Embora modelos independentes tenham descoberto otimizações idênticas em cenários estruturados, os principais gargalos ainda são as falhas de infraestrutura e os custos de GPU resultantes de propostas rejeitadas.
