Atlassian moderniza detecção de incidentes com OpenTelemetry e Kubernetes, otimizando tempo de resposta
Aprofundamento CEVIU
Aprofundamento
A modernização da detecção de incidentes na Atlassian representa um blueprint de engenharia de plataformas para empresas SaaS. O sistema foi redesenhado sobre Apache Kafka para o barramento de eventos, Apache Flink para processamento de stream em tempo real e OpenTelemetry para a telemetria, tudo orquestrado via Kubernetes. A arquitetura inicial, que dependia de máquinas virtuais e processamento com Node.js, gerava uma latência de mais de 40 segundos e sofria com problemas de ruído e alto custo, escalando com cada novo produto.
A nova plataforma filtra eventos já no Kafka, processando apenas o que é relevante para detecção. Um único job Flink com estratégias como enriquecimento assíncrono com cache e circuit breakers, uso de HyperLogLog para contagem de usuários distintos, e sinks idempotentes, garante eficiência. A Atlassian também investiu na robustez do Flink, com estado em RocksDB, checkpoints a cada 30 segundos e otimização do autoscaler. A observabilidade é garantida ponta a ponta com OpenTelemetry, alimentando um TSDB compatível com Prometheus e traços, permitindo que a própria plataforma de detecção seja monitorada, um ponto crítico para sistemas de SRE.
O que mudou
Em julho de 2026, o CEVIU News noticiou a decisão da Atlassian de substituir o Kinesis pelo Kafka para orquestrar um volume massivo de eventos. Essa migração foi um passo estratégico que agora se concretiza como a fundação do novo sistema de detecção de incidentes. O que era uma aposta na escalabilidade do Kafka, que passou a gerenciar 145 bilhões de eventos diários, hoje é uma peça central e validada em um dos sistemas mais críticos da empresa.
A mudança também é visível na otimização de recursos. O sistema antigo demandava 90 máquinas virtuais. A nova arquitetura, rodando sobre Kubernetes, realiza as mesmas funções com apenas 4 pods, demonstrando um ganho expressivo em eficiência e redução de custos operacionais. Esta evolução mostra a consolidação de uma estratégia cloud-native e focada em automação.
Por que isso importa
Essa reengenharia da Atlassian é um exemplo prático de como a adoção de tecnologias cloud-native e padrões de engenharia de dados em tempo real impactam diretamente a confiabilidade de sistemas. Reduzir o tempo de detecção de incidentes de mais de 40 segundos para menos de 10 segundos diminui drasticamente o Mean Time To Detect (MTTD), minimizando o impacto em usuários e a reputação da empresa.
A integração de OpenTelemetry para observabilidade e a orquestração via Kubernetes mostram a maturidade da Atlassian em engenharia de plataformas. A capacidade de autodetecção de problemas no próprio sistema de detecção, juntamente com o uso de IA para investigações iniciais, conforme mencionamos em outras coberturas sobre o tema, solidifica a postura proativa da empresa em SRE.
Linha do tempo
Atlassian substitui Kinesis por Kafka para orquestrar 145 bilhões de eventos diários.
Atlassian Otimiza Análise de Causa Raiz com Automação em Microserviços.
Atlassian moderniza detecção de incidentes com OpenTelemetry e Kubernetes.
Perguntas frequentes
Qual a principal vantagem da nova plataforma de detecção de incidentes da Atlassian?
A principal vantagem é a redução drástica da latência na detecção de incidentes, que passou de mais de 40 segundos para menos de 10 segundos. Isso permite uma resposta muito mais rápida a problemas em produção, minimizando o impacto nos usuários.
Qual o papel do Apache Kafka e Apache Flink na nova arquitetura?
O Apache Kafka atua como o barramento de eventos central, coletando bilhões de telemetrias diárias dos produtos da Atlassian. O Apache Flink processa esses streams de dados em tempo real, realizando filtragens, enriquecimentos e agregação para identificar padrões que indicam um incidente.
Como o Kubernetes contribuiu para a otimização de recursos?
O Kubernetes permitiu uma consolidação de infraestrutura impressionante. O sistema anterior rodava em aproximadamente 90 máquinas virtuais, e a nova plataforma, com a orquestração do Kubernetes, opera com apenas 4 pods, otimizando drasticamente os custos e a eficiência operacional.
O que é OpenTelemetry e por que a Atlassian o utiliza neste contexto?
OpenTelemetry é um conjunto de ferramentas, APIs e SDKs que padroniza a coleta de telemetria (métricas, logs e traces) de aplicações. A Atlassian o utiliza para ter uma visão unificada e agnóstica de fornecedor sobre todo o sistema, monitorando o próprio pipeline de detecção para garantir sua confiabilidade.
Fontes
- cncf.iofonte original
- Categoria
- CEVIU DevOps
- Publicado
- 09 de outubro de 2026
- Editoria
- CEVIU DevOps
