LinkedIn Otimiza Treinamento de Modelos de IA para Busca de Empregos, Acelerando Iterações
Aprofundamento CEVIU
Aprofundamento
O LinkedIn aprofundou sua estratégia de treinamento de modelos de IA com a técnica de destilação de conhecimento multi-teacher. Nesta abordagem, um modelo estudante compacto de 0,6 bilhão de parâmetros aprende com as saídas de três modelos teacher maiores e especializados: um para relevância, outro para engajamento e um terceiro para embeddings. O objetivo é transferir o conhecimento desses modelos complexos para um modelo menor, capaz de operar com baixa latência em produção, essencial para o ranqueamento de milhares de vagas por busca. Essa arquitetura é crucial porque o ranqueamento de vagas exige uma resposta muito rápida, inviabilizando o uso direto de modelos teacher com bilhões de parâmetros.
Para dar conta do volume de dados e da complexidade, a infraestrutura de treinamento evoluiu. Inicialmente, o treinamento levava dias, passando por uma fase de destilação online, onde os teachers inferiam em tempo real junto com o estudante, reduzindo o tempo para cerca de 10 horas. A otimização mais recente, a destilação offline, alcançou menos de 5 horas. Isso foi possível ao separar a inferência dos teachers do treinamento do estudante. Os outputs dos teachers são pré-calculados e armazenados em cache, por shard. Quando o estudante é treinado, ele simplesmente lê esses dados já processados. Essa abordagem, que inclui o uso de PyTorch FSDP, HSDP e GPUs H200, é fundamental para permitir iterações diárias e aprimorar continuamente o sistema de busca de empregos. A necessidade de um modelo compacto e performático é algo que o CEVIU já abordou em 23 de fevereiro de 2026, quando o LinkedIn escalou seus sistemas de ranking baseados em LLMs com o SGLang para as funcionalidades de busca.
O que mudou
A otimização da infraestrutura de treinamento do LinkedIn mostrou uma evolução expressiva. De um processo inicial que levava mais de 45 horas, utilizando destilação online com teachers inferindo em tempo real, a equipe migrou para um sistema de destilação offline. Essa mudança permitiu pré-computar e armazenar em cache as saídas dos modelos teacher no nível do shard. Com isso, o tempo de treinamento caiu para menos de 5 horas. Essa abordagem de caching, que resultou em um ganho de velocidade de mais de 8 vezes, ecoa a estratégia vista em 20 de julho de 2026, quando o Airbnb utilizou caching inteligente para acelerar a avaliação de LLMs de semanas para um dia, indicando uma tendência da indústria em otimizar processos de IA intensivos em dados.
Por que isso importa
A capacidade de reduzir o tempo de treinamento de modelos de IA de dias para menos de 5 horas é um diferencial competitivo enorme. Isso se traduz em ciclos de iteração diários, o que significa que o LinkedIn pode testar, validar e implementar melhorias nas funcionalidades de busca de empregos de forma muito mais ágil. Para os usuários, isso resulta em recomendações de vagas mais relevantes e personalizadas, melhorando a experiência na plataforma. Para a engenharia, essa eficiência libera recursos de computação e permite que as equipes de IA experimentem mais rapidamente, acelerando o desenvolvimento de novos recursos.
Além dos ganhos operacionais, a metodologia de destilação multi-teacher com caching shard-level serve de referência para outras empresas que enfrentam desafios semelhantes. A Meta, por exemplo, tem focado em técnicas para quadruplicar a performance e dobrar a eficiência de treinamento de modelos de anúncio, como noticiado em 6 de agosto de 2026. A abordagem do LinkedIn demonstra como infraestrutura robusta, combinada com estratégias de IA, é essencial para manter a liderança tecnológica em larga escala, especialmente em um ambiente de dados dinâmico como o de um portal de empregos.
Linha do tempo
LinkedIn escala LLMs para ranking de busca com SGLang.
LinkedIn impulsiona melhoria de dados com integrações unificadas.
LinkedIn utiliza agentes de IA para acelerar experimentação de modelos.
LinkedIn otimiza treinamento de modelos de IA para busca de empregos, acelerando iterações.
Perguntas frequentes
O que é a destilação de conhecimento multi-teacher?
É uma técnica onde um modelo de IA menor, chamado estudante, aprende com vários modelos maiores e especializados, os teachers. Cada teacher fornece um tipo diferente de sinal (relevância, engajamento, embeddings) para o estudante, que então consolida esse conhecimento em um modelo mais compacto e eficiente.
Por que o LinkedIn usa um modelo estudante pequeno (0,6 bilhão de parâmetros) para a busca de empregos?
Modelos grandes são muito lentos para as exigências de baixa latência de um sistema de busca de empregos, que precisa ranquear milhares de vagas rapidamente. O modelo estudante de 0,6 bilhão de parâmetros é otimizado para servir em alta velocidade, mantendo a qualidade do ranqueamento aprendida dos modelos teacher maiores.
Como o LinkedIn conseguiu reduzir o tempo de treinamento de 45 horas para menos de 5 horas?
A chave foi a transição para a destilação offline e o caching das saídas dos modelos teacher no nível do shard. Isso significa que as inferências dos teachers são pré-calculadas e armazenadas, eliminando a necessidade de reexecutá-las a cada novo treinamento do modelo estudante, economizando tempo e recursos computacionais.
Quais são os principais benefícios desta otimização para a busca de empregos?
Os benefícios são a capacidade de realizar ciclos de iteração diários, o que permite o aprimoramento contínuo e mais rápido das funcionalidades de IA. Isso resulta em recomendações de vagas mais relevantes para os usuários e uma experiência de busca de empregos mais eficaz na plataforma.
Fontes
- linkedin.comfonte original
- Categoria
- CEVIU Dados
- Publicado
- 10 de agosto de 2026
- Editoria
- CEVIU Dados

