CEVIU Logo
Voltar
Inkling: o novo modelo de IA americano projetado para ser personalizável

O novo modelo de IA americano que promete personalização radical

Aprofundamento CEVIU

Aprofundamento

O Inkling da Thinking Machines aposta alto numa arquitetura de Mixture of Experts (MoE) para escalar o modelo sem explodir os custos operacionais. Embora tenha 975 bilhões de parâmetros no total, apenas cerca de 41 bilhões são ativados para cada token processado. Essa eficiência é crucial, já que o modelo de 66 camadas usa 256 experts por camada, mas seleciona apenas seis para cada token, distribuindo a carga de trabalho de forma inteligente.

Para lidar com uma janela de contexto gigantesca de um milhão de tokens, o Inkling adota uma abordagem híbrida: alterna camadas de "sliding-window" (atenção local) com camadas de atenção completa (global) numa proporção de 5:1. As camadas locais processam o contexto imediato de forma barata, enquanto as camadas globais, que são menos frequentes, garantem que informações distantes no documento possam ser acessadas. Outras inovações incluem a capacidade de integrar dados multimodais, como imagens e áudio, sem a necessidade de encoders pré-treinados separados, e um controle de "thinking effort" que permite ao usuário modular o nível de raciocínio do modelo entre 0 e 1, ajustando a profundidade da análise antes de uma resposta.

O que mudou

Quando o CEVIU News noticiou o lançamento do Inkling em 16 de julho de 2026, a informação girava em torno da sua escala de 975 bilhões de parâmetros e das suas capacidades multimodais. A cobertura atual aprofunda as decisões técnicas que viabilizam essas características. Agora, entendemos a mecânica do roteamento de experts na arquitetura MoE, como a combinação de atenção local e global gerencia o contexto de um milhão de tokens e até mesmo a escolha de uma codificação de posição mais antiga. Essa matéria oferece uma visão concreta e detalhada da engenharia por trás do Inkling, indo além do anúncio inicial para explicar o "como" dos seus recursos.

Por que isso importa

O Inkling da Thinking Machines é um modelo que pode redefinir a acessibilidade de IA de grande escala. Ao disponibilizar seus pesos abertamente sob a licença Apache 2.0, a empresa incentiva a inovação e a personalização por parte de desenvolvedores e outras empresas. A arquitetura MoE e a forma como lida com o contexto são chaves para tornar modelos com quase um trilhão de parâmetros mais acessíveis em termos de custo. Isso significa que mais gente pode experimentar e construir sobre IA avançada, acelerando a criação de aplicações adaptadas e expandindo os horizontes do que é possível com modelos de linguagem.

Linha do tempo

  1. Thinking Machines lança o modelo Inkling, seu primeiro com pesos abertos.

  2. Thinking Machines anuncia o Inkling-Small, uma versão otimizada com menos parâmetros.

  3. Detalhes técnicos aprofundados sobre a arquitetura do Inkling são revelados.

Perguntas frequentes

O que é a arquitetura Mixture of Experts (MoE) no Inkling?

A arquitetura MoE permite que o Inkling tenha 975 bilhões de parâmetros totais, mas ative apenas cerca de 41 bilhões por token processado. Isso significa que o modelo pode ser extremamente grande em capacidade, mas eficiente no uso de recursos, pois apenas uma parte especializada ("experts") é engajada para cada tarefa específica. Isso reduz o custo computacional de modelos gigantes.

Como o Inkling gerencia uma janela de contexto de um milhão de tokens?

Ele usa uma estratégia inteligente, alternando entre camadas de "sliding-window" (atenção local) e camadas de atenção completa (atenção global) numa proporção de 5:1. As camadas locais processam o contexto imediato de forma eficiente, enquanto as camadas globais garantem que informações distantes no texto original possam ser acessadas quando necessário.

Qual a inovação do Inkling na entrada de dados multimodais?

O Inkling pode integrar imagens e áudio diretamente em seu processamento sem a necessidade de um encoder pré-treinado separado para cada modalidade. Isso simplifica o pipeline de desenvolvimento e a compreensão do modelo, permitindo que ele processe diferentes tipos de dados de forma unificada desde o início.

O que significa o controle "thinking effort" no Inkling?

"Thinking effort" é uma configuração que permite ao usuário ajustar o quanto o modelo "raciocina" ou processa a informação antes de gerar uma resposta. É um valor entre 0 e 1, dando controle granular sobre a profundidade da análise do modelo, o que pode ser útil para balancear velocidade e complexidade das respostas.

Fontes

Avalie este artigo:
Categoria
CEVIU IA
Publicado
19 de agosto de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser