Flaky tests em pipelines de CI são frequentemente ignorados porque reproduzir e corrigir esses testes é demorado, causando desperdício de horas de desenvolvedores, recursos de CI e a perda de detecção de falhas reais.

A OpenAI lançou atualizações importantes para seu Agents SDK, que oferecem aos desenvolvedores uma infraestrutura padronizada para construir agentes de IA, com novas capacidades de execução em sandbox, ferramentas de filesystem e integrações com sete provedores de sandbox, incluindo E2B, Modal e Vercel.
O AWS Interconnect é um serviço gerenciado que oferece conexões privadas e de alta velocidade entre a AWS e outros provedores de cloud (iniciando com Google Cloud, e Azure e Oracle Cloud a partir de 2026), além de redes on-premises através de parceiros como a Lumen. O serviço provisiona automaticamente conexões redundantes com criptografia MACsec em múltiplas instalações, eliminando a configuração manual de túneis VPN e de network fabrics de terceiros que as empresas precisavam gerenciar antes.
O Project Think é um SDK de agente de próxima geração que introduz primitivas como execução durável, sub-agentes, execução de código em sandbox e sessões persistentes. O objetivo é permitir agentes de IA de longa duração que não custam nada quando ociosos e escalam automaticamente, resolvendo o desafio econômico de executar milhões de sessões de agentes simultâneas que seriam insustentáveis aos custos atuais por container. A plataforma é construída sobre os Durable Objects da Cloudflare para dar a cada agente sua própria identidade e banco de dados SQLite. Novos recursos como Dynamic Workers (100x mais rápido que containers), resolução de npm em runtime e extensões auto-escritas permitem que os agentes criem suas próprias ferramentas e operem através de uma "escada de execução" de cinco níveis, desde operações de sistema de arquivos até acesso total ao sistema operacional.
O GitHub Copilot melhora a cobertura de testes ao gerar testes unitários a partir do código existente, reduzindo o esforço manual e transformando os testes em um workflow integrado que fortalece a confiabilidade por meio da criação mais rápida de casos de teste significativos e que cobrem branches.
O balanceamento de carga para grandes modelos de linguagem (LLM) exige estratégias de roteamento cientes de cache especializadas. Abordagens tradicionais round-robin podem degradar as taxas de acerto do cache de prompt de 50-90% para apenas 1/N em N réplicas, anulando os benefícios de custo e latência. Uma nova técnica, chamada roteamento preciso ciente de cache de prefixo, que utiliza árvores radix e eventos de cache KV em tempo real de motores de inference, pode melhorar o throughput em até 108% em comparação com o balanceamento de carga padrão do Kubernetes. Isso é alcançado garantindo que as requisições atinjam servidores que já possuem o histórico de conversação relevante em cache.
A Grafana Labs destaca estratégias práticas de observability em Go, enfatizando a importância de iniciar com logs, evoluir para métricas, tracing e profiling, e utilizar ferramentas como pprof e eBPF para depurar sistemas complexos. A discussão ressalta a importância do contexto, das compensações no tratamento de erros e da escolha das técnicas adequadas à medida que a complexidade do sistema aumenta.
O Duolingo migrou mais de 500 serviços de backend do AWS ECS para Kubernetes usando EKS, adotando GitOps com Argo CD, pods exclusivamente IPv6 e uma arquitetura celular para isolar ambientes, enquanto apoiava as equipes de produto por meio de migrações faseadas e automatizadas.
O verdadeiro propósito de um documento de design é criar um entendimento compartilhado e alignment, e não servir como uma entrega final. O próprio ato de escrevê-lo revela lacunas, esclarece decisões e facilita uma melhor colaboração. Documentos de design eficazes definem claramente o problema, os valores, as opções e os tradeoffs. Eles são desenvolvidos iterativamente com feedback para evitar soluções prematuras e garantir um raciocínio sólido.
A Stripe mantém a CI rápida em um monorepo Ruby massivo ao executar apenas um pequeno subconjunto de testes. Isso é feito utilizando a Execução Seletiva de Testes, que rastreia dinamicamente o acesso a arquivos durante as execuções e reexecuta apenas os testes afetados por mudanças no código. Essa abordagem evita análises estáticas não confiáveis, gera grandes economias de compute e mantém a safety por meio de guardrails, como a execução obrigatória de testes críticos ou que falharam anteriormente.
O caching de prompts melhora a latência e reduz custos ao reutilizar estados KV. Contudo, escalar entre réplicas diminui as taxas de acerto do cache, a menos que seja mitigado com afinidade de sessão, roteamento em camadas e balanceamento de carga com reconhecimento de prefixo. O desempenho ideal depende de prompts estruturados, monitoramento e do balanceamento entre os tradeoffs de cache local e compartilhado.
O Kubernetes 1.36, com lançamento previsto para 22 de abril, introduz 20 novas funcionalidades alpha focadas em workloads de IA/ML e GPU, gerenciamento de clusters em larga escala e eficiência de recursos. Entre elas, destacam-se a preempção workload-aware que trata grupos de pods relacionados como unidades únicas durante o agendamento, streams de API sharded para reduzir o overhead de rede em clusters massivos, e uma integração mais profunda com o Dynamic Resource Allocation que simplifica o gerenciamento de GPUs e hardware especializado. A release também traz APIs gRPC a nível de nó para reduzir a carga do API server, suporte nativo a gang scheduling no Job controller, integração com Prometheus Native Histograms e a capacidade do Horizontal Pod Autoscaler de escalar aplicações para zero réplicas com base em métricas externas como o tamanho da fila.
O Datadog Code Security MCP mitiga riscos de código gerado por IA, escaneando em tempo real para detectar vulnerabilidades, segredos e dependências inseguras antes da revisão. Ele consolida múltiplas verificações de segurança em um único workflow local, com controles consistentes e overhead de configuração mínimo.
O controlador ingress-nginx do Kubernetes, mantido pela comunidade e utilizado por aproximadamente metade de todos os ambientes cloud-native, encerrou oficialmente suas atividades em março. Isso ocorreu após anos de manutenção por apenas um ou dois voluntários em seu tempo livre, uma situação que se tornou insustentável após a vulnerabilidade IngressNightmare (CVE-2025-1974, CVSS 9.8) expor como atacantes poderiam obter execução remota de código e ler todos os segredos do cluster. A comunidade Kubernetes está agora migrando para implementações de Gateway API como Envoy Gateway, NGINX Gateway Fabric ou Traefik. Enquanto isso, o controlador separado mantido pela F5/NGINX Inc. permanece ativamente suportado e não foi afetado.
A Databricks lançou o database branching para Lakebase Postgres, utilizando armazenamento copy-on-write para criar ambientes de banco de dados isolados em segundos, sem duplicar dados. Essa novidade substitui a abordagem tradicional de pg_dump, que pode levar horas para grandes bancos de dados.
A Dropbox aprimorou a eficiência de armazenamento em seu blob store imutável, Magic Pocket, ao introduzir uma estratégia de compactação de três camadas que visa diferentes níveis de fragmentação, desde volumes ligeiramente subutilizados até extremamente esparsos. Essa abordagem adaptativa, combinada com ajuste dinâmico e salvaguardas, reduziu significativamente o overhead de armazenamento e permitiu que o sistema recuperasse espaço mais rapidamente, sem sobrecarregar a infraestrutura em escala de exabytes.
Um bom design de software depende da "preguiça" como virtude, impulsionando engenheiros a criar abstrações simples e poderosas que minimizem o trabalho futuro. No entanto, LLMs carecem dessa restrição e tendem a gerar código excessivo e não refinado quando não supervisionados. Consequentemente, LLMs devem ser usados como ferramentas para apoiar o julgamento e a abstração humana, e não para substituí-los, ou correm o risco de aumentar a complexidade do sistema em vez de aprimorá-lo.
A Datadog lançou uma ferramenta de Static Application Security Testing (SAST) open source nativa de IA. Esta solução utiliza Large Language Models para detectar vulnerabilidades em código com significativamente menos falsos positivos em comparação com as ferramentas tradicionais baseadas em regras.
O Traceroute funciona enviando pacotes com valores de TTL crescentes, fazendo com que cada roteador os descarte em sequência e retorne uma mensagem ICMP de "Time Exceeded". Isso revela o IP de cada hop até que o destino responda com uma mensagem ICMP diferente. Ao repetir este processo com múltiplas sondas e medir os tempos de resposta, o Traceroute mapeia o caminho e a latência do tráfego de rede, embora lacunas possam ocorrer quando os roteadores não enviam respostas.
Pulumi agora oferece suporte a Bun como um runtime totalmente compatível, não apenas como um gerenciador de pacotes, a partir da versão 3.227.0. Isso permite que desenvolvedores executem programas Pulumi completos configurando `runtime: bun` no arquivo Pulumi.yaml, eliminando a necessidade de Node.js. A integração proporciona instalação de pacotes mais rápida e suporte nativo para TypeScript. No entanto, atualmente não há suporte para policy packs, serialização de funções ou componentes multi-linguagem, cenários para os quais alguns projetos ainda podem precisar de Node.js.





