A OpenAI revelou os resultados iniciais do Jalapeño, seu inovador acelerador de inferência desenvolvido especificamente para cargas de trabalho de agentes de IA que exigem baixa latência. Com implementação prevista na infraestrutura da própria empresa até o fim do ano, o sistema promete um processamento ágil de prompts e geração de tokens, mantendo a operação coesa e eficiente. Notavelmente, a própria inteligência artificial foi um pilar fundamental no desenvolvimento, auxiliando no design dos circuitos e na programação de kernels, demonstrando a abordagem de "IA para IA" na busca por otimização.

CEVIU News - CEVIU IA - 26 de agosto de 2026
🌶️ CEVIU IA
A Perplexity, em parceria com a Nvidia, acaba de anunciar o 'Portable Computer', uma versão inovadora de sua plataforma de agentes de IA, projetada para operar integralmente no hardware do usuário. Esta solução promete eliminar custos de token, pois o modelo, os dados e o processamento permanecem localmente. Cada tarefa é iniciada no dispositivo e só recorre a modelos na nuvem após solicitação de permissão. Já disponível para assinantes Pro e Enterprise no Linux, com versão para Windows aguardada em setembro, o sistema requer uma GPU RTX com no mínimo 24GB de VRAM.

Um estudo recente levanta questões sobre o tokenizer do Claude, da Anthropic, que opera com surpreendentes 15.000 entradas. Enquanto a comunidade de IA defende vocabulários maiores para modelos de linguagem avançados, o Claude desafia essa lógica. Uma hipótese intrigante sugere que a Anthropic pode estar superando gargalos na camada softmax, otimizando o processo de treinamento e desempenho. Essa abordagem levanta discussões cruciais sobre as estratégias de otimização em IA e o futuro dos modelos linguísticos.

De acordo com a análise de Dylan Patel, a OpenAI e a Anthropic estão a caminho de dominar a maior parte da capacidade computacional utilizável para IA até 2028. Essa projeção se baseia na habilidade dessas gigantes em monetizar FLOPs de forma mais eficiente, permitindo-lhes superar a concorrência na aquisição de infraestrutura crítica. Patel também destaca o crescente investimento em IA, alertando para potenciais riscos de dívida soberana e a centralização econômica que molda o setor, concentrando recursos em poucas mãos.
A OpenAI revela o chip de inferência Jalapeño, projetado especificamente para suas próprias cargas de trabalho de modelos de IA. Testes preliminares indicam que o Jalapeño supera sistemas comerciais, como o GPT-OSS 120B, ao apresentar maior throughput de pico por kilowatt e uma notável redução na latência de token. Este avanço sublinha a estratégia da OpenAI em otimizar a infraestrutura de hardware para impulsionar a eficiência e o desempenho de seus modelos de linguagem, marcando um passo significativo na corrida por soluções de IA mais robustas e eficientes.

Apesar da crescente disponibilidade de inteligência de fronteira, a vantagem competitiva na camada de aplicação não será erradicada. Pelo contrário, o foco do valor migrará para organizações capazes de converter modelos de IA em resultados tangíveis. Os líderes de mercado serão aqueles que dominarem a coordenação eficiente, a gestão estratégica de dados de fluxo de trabalho, a verdadeira transformação da experiência do cliente, a construção de narrativas impactantes, a criação de abstrações de alto nível, a economia orientada a resultados e a identificação de necessidades estruturais. Em suma, a capacidade de integrar e aplicar a IA de forma prática será o grande diferencial.

O Vercel Connect anuncia sua disponibilidade geral, trazendo uma revolução na segurança para agentes de IA. A plataforma substitui os tradicionais tokens de API de longa duração por credenciais emitidas em tempo de execução, que possuem expiração automática e são restritas a tarefas específicas. Esta atualização crucial visa mitigar riscos e otimizar a governança em ambientes de produção, integrando mais de 100 conectores e oferecendo um modelo unificado de integração.

A IBM detalhou a construção de seus modelos Granite 4.2, uma nova geração de LLMs densos e decoder-only projetados para raciocínio avançado. Disponíveis em versões de 3B, 8B e 30B parâmetros, esses modelos foram treinados com impressionantes 15 trilhões de tokens, utilizando uma estratégia de cinco fases que inclui um pipeline de Aprendizado por Reforço (RL) em múltiplas etapas. Um dos destaques é o suporte nativo a chamadas de ferramentas, impulsionado por um mecanismo de alternância THINKING/NON-THINKING, que lhes confere um comportamento 'agentic' aprimorado, especialmente nas versões 8B e 30B, para tarefas como edição de código e busca na web em ambientes reais.

Thibault Sottiaux, líder de produto da OpenAI, projeta aplicar ao ChatGPT Work a mesma estratégia de ajuste de limites de token que impulsionou o crescimento do Codex. Em entrevista, Sottiaux detalha como pretende expandir a capacidade para profissionais que utilizam agentes de IA, abordando o papel do Codex, táticas para engajar usuários céticos, a filosofia de design focada na descoberta e os desafios dos custos operacionais da IA.

A Anthropic promoveu uma integração significativa ao unificar os sistemas de memória do Claude e do Claude Cowork, estabelecendo o compartilhamento de conversas como padrão. Essa novidade permite que as plataformas acessem os mesmos históricos de interação. Agora, o Claude organiza e armazena tópicos de conversa dinamicamente, à medida que o usuário interage, compilando-os em uma lista acessível em 'Tópicos' nas configurações de memória. Os usuários podem gerenciar esses itens individualmente, com opções para leitura, edição ou exclusão, garantindo maior controle e personalização da experiência.

A Apple acaba de revelar seus mais recentes processadores, os chips M6 e M5 Ultra, projetados para serem o coração dos próximos Mac mini e Mac Studio. Essa inovação marca um salto significativo na capacidade de executar modelos de IA diretamente nos dispositivos, prometendo um aumento substancial tanto no desempenho geral quanto no poder de computação dedicado especificamente às aplicações de IA. A iniciativa reforça a estratégia da empresa em fortalecer o processamento local de Inteligência Artificial.
Chris Malone, o principal executivo à frente da construção e ampliação dos data centers da OpenAI, deixou a companhia na semana passada. Sua saída ocorre em um momento crucial, visto que a empresa intensifica seus esforços para expandir a infraestrutura necessária para sustentar o crescente poder computacional exigido pelos seus modelos de IA.

A Applied Compute anuncia o lançamento do AC2, uma plataforma inovadora projetada para revolucionar a forma como equipes de IA desenvolvem e aprimoram seus modelos. Com foco na eficiência, o AC2 promete simplificar as etapas de treinamento, implantação (serving) e otimização contínua de modelos de IA personalizados, endereçando a complexidade e os custos associados a essas operações. Esta novidade representa um avanço significativo para empresas que buscam escalar suas iniciativas em inteligência artificial.

A startup Keenable saiu do 'modo furtivo' com uma proposta ambiciosa para o ecossistema de Inteligência Artificial: um índice web colossal de mais de 100 bilhões de documentos. A empresa também revelou uma API robusta, já em uso por laboratórios de IA de ponta (cujos nomes ainda não foram divulgados), e planos para uma linguagem de consulta inovadora. Essa linguagem permitirá que agentes de IA combinem evidências de múltiplas fontes, prometendo otimizar a tomada de decisões e a compreensão contextual.
Receba as melhores notícias de tech
Conteúdo curado diariamente, direto no seu e-mail.
