LinkedIn Otimiza Observabilidade com ClickHouse para Métricas em Larga Escala
Aprofundamento CEVIU
Aprofundamento
A otimização da observabilidade no LinkedIn com o ClickHouse representa uma virada de chave para a gestão de métricas em larga escala. Anteriormente, a infraestrutura da empresa para metadados de métricas era fragmentada, dependendo de três sistemas distintos, incluindo um índice de busca customizado em memória, um armazenamento de chave-valor customizado em memória e o Elasticsearch. Essa arquitetura legada, além de complexa e cara de manter, não conseguia mais atender às demandas de escala e aos tipos de consultas analíticas que os engenheiros precisavam, especialmente com mais de 13 bilhões de métricas e uma rotatividade diária de 30%.
Com a adoção do ClickHouse, o LinkedIn consolidou essa complexidade em um único cluster, utilizando o motor de tabela ReplicatedReplacingMergeTree para lidar com deduplicação e alta disponibilidade. Projeções foram implementadas para otimizar agregações pesadas, como contagens de serviços para métricas. A migração foi planejada para ser transparente para os usuários finais, já que o tráfego passava por um gateway existente, que agora direciona as consultas para o ClickHouse. Essa abordagem não só simplificou a pilha tecnológica, mas também desbloqueou novas capacidades analíticas que antes eram inviáveis.
O que mudou
A jornada do LinkedIn com o ClickHouse não é nova, mas sua aplicação evoluiu significativamente. Em 2024, a plataforma iniciou a implementação do ClickHouse para gerenciar seu sistema de distributed tracing baseado em OpenTelemetry, um projeto que alcançou grande sucesso, processando centenas de bilhões de spans diariamente. Como o engenheiro Arun Gupta já havia sinalizado em abril de 2026, em um evento do ClickHouse, aquele era "apenas o começo" para a ferramenta no LinkedIn. Agora, a empresa deu o próximo passo ao estender o uso do ClickHouse para o processamento de metadados de métricas.
Essa expansão é a concretização do potencial visto anteriormente. A experiência e a confiança adquiridas no projeto de tracing, onde o ClickHouse demonstrou sua capacidade de ingestão e consulta em tempo real, foram cruciais para a decisão de consolidar os sistemas de métricas. A capacidade do ClickHouse para ingestão de telemetria OpenTelemetry em escala, como abordado pelo CEVIU em 25 de agosto de 2026, reforça as razões para essa escolha. O que era uma aposta de sucesso para tracing se tornou uma solução estratégica e comprovada para um problema ainda maior na observabilidade.
Por que isso importa
Para engenheiros de dados e analistas, a decisão do LinkedIn de unificar sistemas de observabilidade com o ClickHouse é um case de estudo valioso. Ele demonstra a capacidade de um banco de dados OLAP colunar de alto desempenho em substituir pilhas tecnológicas complexas e ineficientes, resultando em ganhos exponenciais de eficiência operacional e redução de custos. A diminuição de cerca de um quinto no uso de memória e dois terços no processamento é um argumento forte para a otimização de infraestrutura em escala.
Além dos ganhos técnicos, essa consolidação libera a equipe de engenharia para focar em inovação, em vez de manutenção de sistemas legados. A capacidade de processar 150.000 consultas por minuto com latência de 68 milissegundos sobre bilhões de métricas, com espaço para dobrar o volume, garante que o LinkedIn possa escalar suas necessidades de observabilidade sem gargalos. Isso valida o ClickHouse como uma escolha robusta para cenários de dados massivos e consultas analíticas exigentes, incentivando outras empresas a explorar soluções semelhantes para suas próprias infraestruturas.
Linha do tempo
LinkedIn inicia implementação do ClickHouse para distributed tracing.
Arun Gupta, do LinkedIn, declara em evento que o uso do ClickHouse era "apenas o começo".
CEVIU noticia sobre a capacidade do ClickHouse para telemetria OpenTelemetry em escala.
LinkedIn consolida sistemas de metadados de métricas com ClickHouse para otimizar observabilidade.
Perguntas frequentes
Qual problema o LinkedIn enfrentava com sua arquitetura de observabilidade de métricas?
O LinkedIn dependia de três sistemas legados distintos para metadados de métricas, incluindo soluções customizadas em memória e Elasticsearch. Essa pilha era cara de manter, complexa, atingiu seus limites de escalabilidade e não conseguia responder a consultas analíticas complexas que os engenheiros precisavam.
Como o ClickHouse resolveu esses desafios no LinkedIn?
O ClickHouse consolidou os três sistemas em um único cluster, otimizando o uso de memória em cerca de um quinto e reduzindo o consumo de computação em dois terços. Ele permitiu o processamento de consultas analíticas que antes eram inviáveis, tudo isso com alta performance e escalabilidade, suportando bilhões de métricas e milhares de consultas por minuto.
Qual foi o papel do gateway existente na migração?
O gateway já funcionava como o ponto de entrada para todas as consultas de metadados. A equipe do LinkedIn o reconfigurou para direcionar as consultas para o ClickHouse, em vez dos sistemas legados. Isso tornou a migração transparente, sem a necessidade de alterar ferramentas ou serviços downstream que já dependiam do gateway.
O LinkedIn já usava ClickHouse antes para outros fins?
Sim, a jornada do LinkedIn com o ClickHouse começou dois anos antes da consolidação de métricas, com a implementação bem-sucedida para o gerenciamento de distributed tracing baseado em OpenTelemetry. Essa experiência prévia e a confiança na ferramenta pavimentaram o caminho para sua expansão para os metadados de métricas.
Fontes
- clickhouse.comfonte original
- Categoria
- CEVIU Dados
- Publicado
- 05 de outubro de 2026
- Editoria
- CEVIU Dados

