Voltar
CDC na WHOOP: Replicação Self-Service para Centenas de Tabelas Postgres

WHOOP Inova com CDC Self-Service para Replicação de Dados Postgres

Aprofundamento CEVIU

Aprofundamento

A WHOOP, gigante de wearables, demonstra com sua nova solução de CDC self-service um caminho maduro para a replicação de dados em larga escala. A engenharia por trás do sistema foca na separação explícita entre a captura de eventos de mudança brutos e a materialização de tabelas, um conceito que o CEVIU News já explorou em outras implementações. Ao desacoplar o streaming dos upserts, a WHOOP consegue otimizar os custos computacionais e a performance, um desafio comum em sistemas de dados complexos que a Grab também enfrentou ao desenvolver sua plataforma unificada de ingestão de dados com Apache Flink, conforme noticiado em 25 de maio de 2026.

A arquitetura se baseia em camadas Bronze e Silver. A camada Bronze captura os eventos de CDC do Debezium, usando publicações do PostgreSQL e Kafka, e os serializa como Avro com o AWS Glue Schema Registry. Esta camada é append-only, garantindo escritas baratas e eficientes. A camada Silver, por sua vez, é onde as réplicas reais das tabelas Postgres vivem no Iceberg, com upserts batched a cada quatro horas. Essa distinção permite que consumidores com diferentes necessidades de latência escolham entre os dados brutos de baixa latência (Bronze) ou a visão materializada (Silver). A automatização da evolução do esquema de dados e a transferência da propriedade operacional para as equipes de aplicação reforçam o conceito de plataformas self-service, ecoando a estratégia da Wix Engineering ao conectar o Apache Iceberg a microsserviços em produção, notícia de 19 de fevereiro de 2026.

O que mudou

Antes, a WHOOP usava um pipeline Debezium para Kafka e um job Spark Structured Streaming por tabela para fazer upserts em Iceberg a cada 30 minutos. Este modelo gerava altos custos, exigia intervenção manual para mudanças de esquema e falhava na observabilidade. A grande mudança está na separação das responsabilidades: a nova arquitetura divide a ingestão em duas camadas, Bronze para eventos brutos e Silver para réplicas materializadas, rodando upserts de forma mais parcimoniosa. Essa abordagem reduziu custos e automatizou processos que antes demandavam tickets e coordenação, como a evolução do esquema de dados, que agora propaga alterações do Postgres para o Iceberg sem intervenção humana.

Por que isso importa

A solução da WHOOP é um estudo de caso valioso sobre como otimizar pipelines de CDC em grande escala. A empresa mostra que é possível ter agilidade e controle sem abrir mão da eficiência. Ao alinhar a responsabilidade operacional com as equipes de origem dos dados e automatizar processos como a evolução do esquema, a WHOOP não apenas reduziu custos operacionais, mas também acelerou a disponibilização de dados frescos para análise e microsserviços. Esta é uma lição importante para qualquer empresa que lida com grandes volumes de dados transacionais, fornecendo um modelo para arquiteturas de dados mais robustas e escaláveis.

Linha do tempo

  1. Wix Engineering desenvolve plataforma self-service para conectar Apache Iceberg a microsserviços em produção.

  2. CEVIU News publica artigo explicando o conceito de Change Data Capture (CDC) e suas ferramentas populares.

  3. Halodoc implementa camadas de auto-cura para pipelines de dados, incluindo reinícios automáticos de CDC.

  4. Grab unifica ingestão de dados self-service com Apache Flink, incluindo CDC de RDS e Kafka.

  5. Snowflake anuncia integração de CDC Push-Based para PostgreSQL, aprimorando replicação de dados.

  6. Pinterest aprimora ingestão de dados com finalização de partição em seu framework de CDC.

  7. WHOOP implementa pipeline de Change Data Capture self-service para replicação de dados Postgres.

Perguntas frequentes

O que é Change Data Capture (CDC) e por que é importante para a WHOOP?

CDC é uma técnica que rastreia e transmite apenas as alterações em um banco de dados, em vez de copiar tabelas inteiras. Para a WHOOP, isso é crucial para replicar dados do PostgreSQL de forma eficiente para seu data warehouse, permitindo análises quase em tempo real sem sobrecarregar os sistemas de origem.

Como a WHOOP resolveu o problema de custos de upserts contínuos?

A WHOOP dividiu seu pipeline CDC em duas camadas: Bronze (para eventos brutos, append-only) e Silver (para réplicas materializadas com upserts batched a cada quatro horas). Essa separação permite escritas mais baratas e reduz a frequência de operações de merge caras, economizando recursos computacionais.

Qual o papel do Apache Iceberg e do Apache Flink na nova arquitetura da WHOOP?

O Apache Iceberg é usado nas camadas Bronze e Silver para armazenar os dados de forma eficiente, aproveitando seus recursos de esquema evolutivo e otimizações de merge. O Apache Flink processa os dados da camada Bronze, roteando os eventos de Kafka para as tabelas Iceberg, operando de forma performática e escalável.

Como a evolução do esquema de dados foi automatizada pela WHOOP?

Quando uma nova coluna é adicionada no PostgreSQL, o Debezium a registra no AWS Glue Schema Registry como Avro. O Flink e o Iceberg automaticamente incorporam essa nova coluna e suas alterações de tipo nas camadas Bronze e Silver, eliminando a necessidade de intervenção manual da equipe de plataforma de dados.

Fontes

Avalie este artigo:
Categoria
CEVIU Dados
Publicado
08 de outubro de 2026
Editoria
CEVIU Dados

Quer receber mais sobre CEVIU Dados?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser