Microsoft inova com Transformers Full-bandwidth que otimizam processamento latente
Aprofundamento CEVIU
Aprofundamento
Os Transformers Full-bandwidth da Microsoft representam um avanço na forma como os modelos de linguagem processam informações. A inovação central é a capacidade de realimentar o "estado oculto" da camada superior do token anterior, combinado com o embedding do próximo token, usando uma unidade linear gateada. Esse mecanismo cria um "canal de feedback vertical" mais amplo, permitindo que a computação latente, o raciocínio não verbalizado, seja continuamente mantida e progredida entre as etapas de decodificação. Assim, a pilha de processamento recebe informações mais ricas a cada passo.
A arquitetura mantém compatibilidade com os Transformers padrão, incluindo o cache KV e o objetivo de modelagem de linguagem. A Microsoft treinou esses modelos usando um objetivo multi-pass programado, que introduz o feedback latente mais tarde no pré-treinamento para estabilidade. O resultado? Modelos de 1 bilhão de parâmetros apresentaram melhorias na perda de validação, na avaliação de modelos de linguagem com 5-shot, na geração de matemática e código, e no desempenho de modelos ajustados por instrução. Essencialmente, eles igualam ou superam Transformers padrão treinados com cerca de 1,5 vezes mais tokens, conseguindo rastros de raciocínio mais curtos com igual ou melhor precisão.
O que mudou
A discussão sobre otimização e reutilização de recursos em Transformers tem ganhado força. Em nossa cobertura de 29 de julho de 2026, destacamos os "Transformers em Loop", que reutilizam camadas centrais para otimizar recursos. Os Full-bandwidth Transformers da Microsoft levam essa ideia para outro nível, focando no "feedback latente". Enquanto os modelos em loop reutilizam blocos computacionais, a nova arquitetura realimenta diretamente o estado oculto da camada superior. Isso significa que o modelo aproveita não só a estrutura da camada, mas o próprio "pensamento" interno que ela gerou, criando um fluxo de informações mais contínuo e aprofundado entre os passos de decodificação. É uma evolução do conceito de otimização pela reutilização.
Por que isso importa
Esta inovação é um avanço significativo para a eficiência da IA. Ela permite que modelos de linguagem alcancem desempenho superior com menos recursos computacionais e, potencialmente, menos dados de treinamento. Isso se traduz em modelos mais rápidos, mais baratos de operar e mais acessíveis, democratizando o acesso a capacidades avançadas de IA. Reduzir a necessidade de bilhões de tokens para treinamento e otimizar a inferência tem implicações diretas na sustentabilidade, diminuindo a pegada de carbono da IA. Além disso, a capacidade de gerar raciocínios mais curtos e precisos é crucial para tarefas complexas como programação e resolução de problemas matemáticos, ampliando as fronteiras do que os modelos podem fazer.
Linha do tempo
Microsoft inova com MAI-Image-2.5-Pro para imagens e MAI-Voice-2-Flash para voz
Transformers em Loop: Uma Revolução na Eficiência de Modelos de IA
Liquid AI Apresenta Encoders de Contexto Longo Otimizados para CPUs
OpenAI Otimiza Desempenho e Custo com a Nova Geração GPT-5.6
Microsoft revela MAI-Thinking-1, modelo de raciocínio para otimizar custos corporativos
Cerebras e OpenAI Elevam Performance da IA com GPT-5.6 Sol Ultrafast
Microsoft inova com Transformers Full-bandwidth que otimizam processamento latente
Perguntas frequentes
O que são os Transformers Full-bandwidth?
São uma nova arquitetura da Microsoft para modelos de linguagem. Eles otimizam o processamento ao realimentar o estado oculto da camada superior do token anterior, integrado ao embedding do próximo token. Isso permite que a computação latente seja mantida e progredida de forma contínua.
Como essa tecnologia melhora o desempenho dos modelos de IA?
Ela otimiza o desempenho e os recursos computacionais. Os Transformers Full-bandwidth melhoram a perda de validação, a avaliação de modelos de linguagem e a geração de código e matemática. Eles alcançam o mesmo desempenho de modelos padrão que usaram 1,5 vezes mais tokens de treinamento.
O que é "feedback latente" neste contexto?
É o mecanismo central da arquitetura. Refere-se à realimentação do estado oculto da camada superior de um token para o input do próximo token. Isso permite que a informação processada internamente, mas não verbalizada, seja reaproveitada na próxima etapa da computação.
Os Transformers Full-bandwidth exigem uma arquitetura de Transformer completamente nova?
Não, a arquitetura foi projetada para preservar elementos fundamentais dos Transformers padrão, como o cache KV e o objetivo de modelagem de linguagem. A inovação está no aprimoramento do "canal de feedback vertical", não em uma reestruturação total.
Fontes
- arxiv.orgfonte original
- Categoria
- CEVIU IA
- Publicado
- 17 de agosto de 2026
- Editoria
- CEVIU IA
