CEVIU Logo
Voltar
Credenciais Sensíveis Expostas em 7.6 Petabytes de Dados de Treinamento do Hugging Face

Mega Vazamento de Credenciais em Dados de Treinamento de IA no Hugging Face Acende Alerta

Aprofundamento CEVIU

Aprofundamento

A varredura da Truffle Security em 7.6 petabytes de datasets públicos do Hugging Face revelou um cenário assustador: mais de 221 mil credenciais ativas e únicas expostas. Isso inclui tokens de acesso pessoal do GitHub com capacidade de gravação, tokens de push do Docker Hub, chaves do Google Cloud Platform e acessos funcionais a bancos de dados. A escala da exposição é gigantesca. Encontramos exemplos de chaves em mais de 6 mil conjuntos de dados, o que mostra como credenciais críticas para a infraestrutura de TI podem estar disseminadas na base de treinamento de modelos de IA.

O problema não é só a quantidade, mas o potencial de dano. As chaves de API da OpenAI e Anthropic, por exemplo, somam um custo anual potencial de quase um milhão de dólares em abusos de inferência. Já as credenciais com acesso de gravação no GitHub ou Docker podem ser usadas em ataques de cadeia de suprimentos de software, permitindo a injeção de código malicioso ou o comprometimento de artefatos que chegam a milhões de usuários. A reincidência de 44% das credenciais em múltiplos datasets piora o cenário, amplificando o risco de forma mecânica, já que cada cópia é mais um ponto de exploração.

O que mudou

Em março de 2026, a cobertura do CEVIU sobre o relatório da GitGuardian já alertava para um aumento de 81% nos vazamentos de serviços de IA, impulsionado pela codificação assistida por IA. O levantamento da Truffle Security agora materializa essa preocupação, mostrando a escala real do problema nos dados de treinamento. O que era uma estatística generalizada sobre tendências de vazamento, virou uma descoberta concreta de centenas de milhares de credenciais ativas e sensíveis, provando que a base que alimenta o desenvolvimento de IAs está profundamente comprometida.

Por que isso importa

Este vazamento massivo de credenciais, encontradas nos próprios dados de treinamento de IA, reconfigura a paisagem da cibersegurança. Para empresas, a integridade da cadeia de suprimentos de software está em risco, já que tokens com acesso de gravação podem ser explorados para comprometer repositórios e imagens de contêiner. Além disso, chaves de plataformas de nuvem e bancos de dados expostas abrem portas para acessos não autorizados a infraestruturas críticas e dados confidenciais. A descoberta valida alertas anteriores sobre a IA Sombra e a crescente exposição de ferramentas de IA, elevando a necessidade de políticas rigorosas de segurança e verificação contínua.

Linha do tempo

  1. GitGuardian Reporta Aumento de 81% em Vazamentos de Serviços de IA.

  2. Análise da Grip Security expõe o Problema da IA Sombra em aplicativos SaaS.

  3. Vulnerabilidade GitLost no Agente de IA do GitHub expõe repositórios privados.

  4. Hugging Face Sofre Invasão por Agente de IA Autônomo, credenciais roubadas.

  5. Relatório da Censys aponta crescimento de 60% em ferramentas de IA/LLM expostas na internet.

  6. Mega Vazamento de Credenciais em Dados de Treinamento de IA no Hugging Face.

Perguntas frequentes

Quais tipos de credenciais foram mais impactados no vazamento do Hugging Face?

A análise da Truffle Security identificou 221.303 credenciais ativas e únicas. Entre as mais críticas, estão 349 PATs do GitHub com acesso de gravação, 318 tokens de push do Docker Hub, 8.557 chaves ativas do Google Cloud Platform e 8.594 logins funcionais de banco de dados. Também foram encontradas 742 chaves da OpenAI e 26 da Anthropic.

Qual o risco financeiro e de segurança dessas credenciais expostas?

O risco financeiro é substancial, com um custo potencial de abuso de inferência de chaves de IA estimado em US$ 920 mil anuais. No campo da segurança, credenciais de gravação no GitHub ou Docker representam uma ameaça direta à cadeia de suprimentos de software, permitindo que atacantes injetem código malicioso ou comprometam modelos. Chaves de nuvem e banco de dados podem expor dados sensíveis e infraestruturas críticas.

Como essas credenciais acabaram nos dados de treinamento de IA?

A maioria das credenciais vazou de outros lugares, como repositórios públicos ou chats, sendo posteriormente coletadas por grandes corpora de web scraping. Esses corpora, ao serem usados para criar datasets de treinamento de IA, replicam e amplificam o vazamento. Em alguns casos, as credenciais são 'autovazamentos', onde os próprios publicadores de datasets as incluíram acidentalmente.

Que medidas foram tomadas ou são recomendadas após o vazamento?

O Hugging Face foi notificado e colaborou, integrando o TruffleHog para varredura de seus buckets, além de já revogar tokens de empresas em repositórios públicos. A recomendação é clara: tratar toda chave exposta como comprometida, revogá-las imediatamente e realizar varreduras de segurança pré-publicação em todos os datasets para evitar novos vazamentos.

Fontes

Avalie este artigo:
Compartilhar:
Categoria
CEVIU Segurança da Informação
Publicado
03 de agosto de 2026
Editoria
CEVIU Segurança da Informação

Quer receber mais sobre CEVIU Segurança da Informação?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser