O Lighthouse Attention, um mecanismo hierárquico de attention baseado em seleção, é até 17 vezes mais rápido em passes forward e backward do que os modelos de attention padrão em contextos grandes. Ele utiliza FlashAttention em uma sub-sequência densa, garantindo eficiência e compatibilidade com melhorias existentes. Ao possibilitar o treinamento eficiente de modelos com contexto longo e manter a competência de um dense model, o Lighthouse Attention alcança um aumento de velocidade de 1.4x a 1.7x no pré-treinamento, enquanto reduz os custos computacionais.

CEVIU IA
Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados
2317 notícias
Steering é a ideia de que as saídas de LLMs podem ser guiadas manipulando-se diretamente as ativações de um modelo em tempo de execução, e com o DeepSeek-V4-Flash, essa técnica ganha um novo patamar de interesse e aplicabilidade.
O OpenRouter custa cerca de um terço do preço e oferece aproximadamente o dobro da velocidade para modelos comparáveis.
O boom da IA criou uma divisão de riqueza, com cerca de 10.000 indivíduos de empresas como OpenAI e Nvidia atingindo mais de US$ 20 milhões em patrimônio, enquanto outros enfrentam futuros incertos com perspectivas de emprego estagnadas e demissões. Engenheiros de software expressam preocupações sobre a obsolescência de suas habilidades, aumentando a ansiedade sobre as carreiras. Essa disparidade alimenta a tensão no cenário tecnológico de São Francisco, enquanto alguns criticam o duplo papel da IA como fonte de riqueza e ameaça de carreira.
O Google está implementando uma nova opção de 'Thinking level' para o Gemini. A opção já apareceu para alguns usuários ao selecionar Fast ou Gemini 3.1 Pro. Além disso, o Google prepara a adição de mais integrações com aplicativos de terceiros no Gemini, com suporte para Canva, Instacart e OpenTable aparentemente a caminho.
A OpenAI está desenvolvendo uma funcionalidade que permitirá ao seu agente de codificação, o Codex, operar aplicativos do macOS através do Computer Use, mesmo quando um laptop estiver bloqueado ou em modo de suspensão. Atualmente, o Computer Use requer uma sessão desbloqueada e ativa para visualizar a tela, mover o cursor e digitar. A remoção dessa restrição permitirá que os usuários direcionem seus agentes sem a necessidade de retornar fisicamente às suas máquinas para fazer login primeiro. A data de lançamento do recurso ainda não foi divulgada.
Laboratórios de IA estão travando uma guerra contínua pelos recursos de GPU. A demanda e a oferta atuais indicam que a infraestrutura que impulsiona a IA pode não ser suficiente, e escalar GPUs não aumenta o poder computacional de forma linear. A eficiência torna-se crucial em larga escala, dada a oferta finita.
A portabilidade de kernel em IA é estruturalmente impossível porque o Pallas da TPU, o CuTile e o CUTLASS da NVIDIA, o NKI da AWS, o FlyDSL da AMD e o tt-Metalium da Tenstorrent expõem conceitos específicos de hardware que nenhuma DSL universal pode unificar. A evidência é que o MoE grouped matmul do MaxText é implementado em 282 linhas de Pallas na TPU, enquanto o equivalente do Flashinfer para Blackwell SM100 requer 4 milhões de linhas de CUDA gerado, sem código compartilhado, pois os próprios algoritmos divergem entre hardwares.
A OpenAI adquiriu a equipe de seis pessoas e suas propriedades intelectuais da startup Weights.gg, e então encerrou as operações da Weights.gg e distribuiu seus membros em vários grupos internos da OpenAI.
O Claude Code está sendo usado em produção em várias grandes bases de código em organizações com milhares de desenvolvedores. Esses ambientes apresentam desafios que bases de código menores não possuem. Este artigo aborda padrões que a Anthropic observou e que levaram à adoção bem-sucedida do Claude Code em escala, incluindo seu uso em monorepos com milhões de linhas, sistemas legados construídos ao longo de décadas e microservices em repositórios separados.
As execuções de pré-treinamento frequentemente falham. Este artigo explora todas as formas pelas quais as coisas podem dar errado e por que o treinamento é uma operação tão precária. Os principais culpados parecem ser a quebra de causalidade e a adição de viés.
O tamanho do KV-cache, o tráfego de memória e o custo da attention rapidamente se tornam as principais restrições à medida que modelos de raciocínio e fluxos de trabalho de agentes mantêm mais tokens por mais tempo. Desenvolvedores de LLMs estão adicionando um número crescente de truques arquitetônicos para reduzir custos. A maioria das mudanças parece pequenos ajustes, mas algumas são alterações de design bastante intrincadas. Este artigo examina essas mudanças arquitetônicas com foco no que muda dentro do bloco transformer, residual stream, KV cache e computação de attention.
Os fundadores da Runway acreditam que a próxima forma de IA será construída a partir de modelos de vídeo e modelos de mundo que aprendem como o mundo funciona. A empresa está treinando modelos diretamente em dados de observação para alcançar a próxima fronteira da IA. A Runway foi uma das primeiras a desenvolver a geração de vídeo por IA, mas os modelos de mundo representam uma corrida diferente, com concorrentes de grande porte. A empresa já levantou US$ 860 milhões, mas está competindo contra grandes players como OpenAI e Google.
O Cursor detalhou um novo sistema para configurar ambientes de desenvolvimento baseados em cloud sob medida para agentes autônomos de programação. O sistema oferece suporte a multi-repositórios, configuração de ambiente como código, workflows automatizados de setup e controles de governança para gerenciar frotas de agentes paralelos.
Existem duas formas de criar sandbox para agentes que executam código: isolar a ferramenta ou isolar o agente. Agentes devem ter nada que valha a pena roubar e nada que valha a pena preservar. Isolar o agente requer um salto de rede adicional em cada operação e mais serviços para deploy, mas não há segredos para roubar, nenhum estado para preservar, e agentes podem ser mortos, reiniciados e escalados independentemente.
O Codex implementou hooks e tokens programáticos para facilitar a automação e customização de código. Os hooks permitem personalizar o loop do Codex com scripts que executam em pontos-chave de uma tarefa. O acesso programático fornece credenciais com escopo definido para equipes Business e Enterprise. Está disponível um vídeo mostrando como criar tokens de acesso para automações do Codex.
Genkit é um framework para construir aplicações full-stack com IA e agentic para qualquer plataforma. Suporta TypeScript, Go, Dart e Python. O Genkit usa hooks composáveis que interceptam chamadas de geração para implementar tentativas e fallbacks para máxima confiabilidade, aprovação humana antes de chamadas de ferramentas destrutivas, e observability em todas as camadas. Seu sistema de middleware executa um loop de ferramentas que se repete até o modelo terminar. O Genkit Developer pode ser usado para inspecionar, testar e debugar aplicações e execução de middleware.
A OpenSquilla apresentou um runtime de agente de IA open-source projetado para reduzir gastos desnecessários com tokens através da reutilização eficiente de contexto.
O Toto 2.0 da Datadog, uma família de modelos escaláveis para previsão de séries temporais, está agora disponível no Hugging Face.
Babuschkin, cofundador da xAI, está investindo US$ 100 milhões do próprio dinheiro na empresa.





