Anthropic Apresenta Mecanismo de Desativação para Conhecimento de Duplo Uso em Modelos de IA
Aprofundamento CEVIU
Aprofundamento
A Anthropic trouxe uma novidade importante para a segurança de modelos de IA com o GRAM (Gradient-Routed Auxiliary Modules). A ideia central é dar aos modelos compartimentos dedicados e removíveis para cada categoria de conhecimento de duplo uso, como cibersegurança ou virologia. Em vez de treinar vários modelos caros com diferentes conjuntos de dados filtrados, o GRAM permite que um único treinamento crie um modelo com a flexibilidade de ativar ou desativar conhecimentos específicos.
Funciona assim: o modelo, que se baseia na arquitetura Transformer, tem neurônios extras divididos em módulos por categoria. Quando ele encontra texto geral, aprende normalmente. Mas, ao processar dados de duplo uso, apenas o módulo correspondente aprende com aquele texto, enquanto o restante das partes do modelo permanece congelado. Isso concentra o conhecimento sensível nos módulos, permitindo que sejam removidos após o treinamento, eliminando a capacidade indesejada sem comprometer a performance geral do modelo. A pesquisa, ainda em estágio inicial, mostrou que o GRAM se equipara à filtragem de dados e que sua eficácia aumenta com o tamanho do modelo, tornando mais difícil e caro para um atacante tentar reverter a remoção de conhecimento.
O que mudou
Em sua busca por segurança, a Anthropic já havia explorado métodos como a filtragem de informações de duplo uso durante o pré-treinamento e a segregação de conhecimento em fatias removíveis dentro do modelo. No entanto, essas abordagens eram limitadas, gerando um modelo com capacidades fixas. Se fosse preciso uma versão que pudesse discutir virologia e outra que não, seriam necessários dois treinamentos caríssimos, como noticiado em 16 de junho de 2026 sobre as restrições de segurança que viraram vantagem estratégica.
O GRAM representa um avanço significativo. Ele oferece a vantagem de ter múltiplos modelos filtrados, mas ao custo de treinar apenas um. Em vez de “filtrar” na fonte ou em fatias menos cirúrgicas, ele cria módulos que podem ser desativados seletivamente após o treinamento, conforme a notícia de 5 de julho de 2026 sobre a adoção de filtros de segurança cibernética no Fable 5. É uma evolução de salvaguardas que antes focavam em recusar solicitações perigosas, para um controle fundamental sobre o que o modelo realmente sabe.
Por que isso importa
Controlar o conhecimento de duplo uso é um desafio crítico para a IA, especialmente com a crescente capacidade dos modelos de ponta. O GRAM oferece uma solução para um problema central: como permitir que usuários confiáveis acessem capacidades importantes (como cibersegurança defensiva) sem abrir margem para uso malicioso. Ao permitir a remoção cirúrgica de conhecimento sem afetar o desempenho geral ou exigir o treinamento de múltiplos modelos, ele torna a implantação de IA avançada muito mais segura e custo-efetiva.
Essa abordagem é fundamental para a responsabilidade no desenvolvimento de IA. Ela assegura que, mesmo que um atacante consiga contornar as defesas de “recusa”, o conhecimento subjacente perigoso simplesmente não estará lá, oferecendo uma camada de proteção mais robusta. Isso é essencial para manter a confiança e o uso ético de tecnologias de IA cada vez mais potentes.
Linha do tempo
Anthropic transforma restrições de segurança em vantagem estratégica
Knowledge Agents superam frontier models com uma estrutura melhor
Anthropic adota novos filtros de segurança cibernética e framework de jailbreak no Fable 5
Anthropic revela o 'Espaço-J', um padrão neural interno no Claude
Anthropic apresenta o GRAM, um mecanismo de desativação para conhecimento de duplo uso em modelos de IA
Perguntas frequentes
O que é GRAM (Gradient-Routed Auxiliary Modules)?
GRAM é um novo método de segurança da Anthropic que permite que modelos de IA incorporem e gerenciem categorias de conhecimento de duplo uso de forma modular. Ele usa compartimentos dedicados que podem ser ativados ou desativados após o treinamento, permitindo maior controle sobre o que o modelo 'sabe' sem precisar treinar múltiplos modelos.
Como o GRAM melhora a segurança dos modelos de IA?
O GRAM melhora a segurança ao permitir a exclusão seletiva de partes do conhecimento de duplo uso do modelo após o treinamento. Isso impede que atacantes acessem informações sensíveis mesmo se conseguirem contornar as defesas de saída, garantindo que o conhecimento perigoso não esteja mais presente na memória do modelo. É um controle sobre o 'conhecimento' do modelo, e não apenas sobre sua 'saída'.
O que são 'capacidades de duplo uso' no contexto de IA?
Capacidades de duplo uso se referem a conhecimentos que podem ser empregados tanto para fins benéficos quanto maliciosos. Exemplos incluem informações sobre cibersegurança (para defesa ou ataque) ou virologia (para desenvolvimento de vacinas ou armas biológicas). O GRAM busca gerenciar esse tipo de conhecimento sensível dentro dos modelos de IA.
O GRAM já está sendo usado nos modelos de produção da Anthropic, como o Claude?
Não, a Anthropic esclarece que o GRAM é uma pesquisa inicial e ainda não foi aplicado aos modelos de produção como o Claude. Não há garantia de que será implementado, mas os resultados dos experimentos preliminares são promissores, mostrando a viabilidade da abordagem.
Fontes
- anthropic.comfonte original
- Categoria
- CEVIU IA
- Publicado
- 11 de julho de 2026
- Editoria
- CEVIU IA
