Mega Vazamento de Credenciais em Dados de Treinamento de IA no Hugging Face Acende Alerta
Aprofundamento CEVIU
Aprofundamento
A varredura da Truffle Security em 7.6 petabytes de datasets públicos do Hugging Face revelou um cenário assustador: mais de 221 mil credenciais ativas e únicas expostas. Isso inclui tokens de acesso pessoal do GitHub com capacidade de gravação, tokens de push do Docker Hub, chaves do Google Cloud Platform e acessos funcionais a bancos de dados. A escala da exposição é gigantesca. Encontramos exemplos de chaves em mais de 6 mil conjuntos de dados, o que mostra como credenciais críticas para a infraestrutura de TI podem estar disseminadas na base de treinamento de modelos de IA.
O problema não é só a quantidade, mas o potencial de dano. As chaves de API da OpenAI e Anthropic, por exemplo, somam um custo anual potencial de quase um milhão de dólares em abusos de inferência. Já as credenciais com acesso de gravação no GitHub ou Docker podem ser usadas em ataques de cadeia de suprimentos de software, permitindo a injeção de código malicioso ou o comprometimento de artefatos que chegam a milhões de usuários. A reincidência de 44% das credenciais em múltiplos datasets piora o cenário, amplificando o risco de forma mecânica, já que cada cópia é mais um ponto de exploração.
O que mudou
Em março de 2026, a cobertura do CEVIU sobre o relatório da GitGuardian já alertava para um aumento de 81% nos vazamentos de serviços de IA, impulsionado pela codificação assistida por IA. O levantamento da Truffle Security agora materializa essa preocupação, mostrando a escala real do problema nos dados de treinamento. O que era uma estatística generalizada sobre tendências de vazamento, virou uma descoberta concreta de centenas de milhares de credenciais ativas e sensíveis, provando que a base que alimenta o desenvolvimento de IAs está profundamente comprometida.
Por que isso importa
Este vazamento massivo de credenciais, encontradas nos próprios dados de treinamento de IA, reconfigura a paisagem da cibersegurança. Para empresas, a integridade da cadeia de suprimentos de software está em risco, já que tokens com acesso de gravação podem ser explorados para comprometer repositórios e imagens de contêiner. Além disso, chaves de plataformas de nuvem e bancos de dados expostas abrem portas para acessos não autorizados a infraestruturas críticas e dados confidenciais. A descoberta valida alertas anteriores sobre a IA Sombra e a crescente exposição de ferramentas de IA, elevando a necessidade de políticas rigorosas de segurança e verificação contínua.
Linha do tempo
GitGuardian Reporta Aumento de 81% em Vazamentos de Serviços de IA.
Análise da Grip Security expõe o Problema da IA Sombra em aplicativos SaaS.
Vulnerabilidade GitLost no Agente de IA do GitHub expõe repositórios privados.
Hugging Face Sofre Invasão por Agente de IA Autônomo, credenciais roubadas.
Relatório da Censys aponta crescimento de 60% em ferramentas de IA/LLM expostas na internet.
Mega Vazamento de Credenciais em Dados de Treinamento de IA no Hugging Face.
Perguntas frequentes
Quais tipos de credenciais foram mais impactados no vazamento do Hugging Face?
A análise da Truffle Security identificou 221.303 credenciais ativas e únicas. Entre as mais críticas, estão 349 PATs do GitHub com acesso de gravação, 318 tokens de push do Docker Hub, 8.557 chaves ativas do Google Cloud Platform e 8.594 logins funcionais de banco de dados. Também foram encontradas 742 chaves da OpenAI e 26 da Anthropic.
Qual o risco financeiro e de segurança dessas credenciais expostas?
O risco financeiro é substancial, com um custo potencial de abuso de inferência de chaves de IA estimado em US$ 920 mil anuais. No campo da segurança, credenciais de gravação no GitHub ou Docker representam uma ameaça direta à cadeia de suprimentos de software, permitindo que atacantes injetem código malicioso ou comprometam modelos. Chaves de nuvem e banco de dados podem expor dados sensíveis e infraestruturas críticas.
Como essas credenciais acabaram nos dados de treinamento de IA?
A maioria das credenciais vazou de outros lugares, como repositórios públicos ou chats, sendo posteriormente coletadas por grandes corpora de web scraping. Esses corpora, ao serem usados para criar datasets de treinamento de IA, replicam e amplificam o vazamento. Em alguns casos, as credenciais são 'autovazamentos', onde os próprios publicadores de datasets as incluíram acidentalmente.
Que medidas foram tomadas ou são recomendadas após o vazamento?
O Hugging Face foi notificado e colaborou, integrando o TruffleHog para varredura de seus buckets, além de já revogar tokens de empresas em repositórios públicos. A recomendação é clara: tratar toda chave exposta como comprometida, revogá-las imediatamente e realizar varreduras de segurança pré-publicação em todos os datasets para evitar novos vazamentos.
Fontes
- trufflesecurity.comfonte original
- Categoria
- CEVIU Segurança da Informação
- Publicado
- 03 de agosto de 2026
- Editoria
- CEVIU Segurança da Informação

