CEVIU IA
Todas as notícias

CEVIU IA

Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados

2317 notícias

O Lighthouse Attention, um mecanismo hierárquico de attention baseado em seleção, é até 17 vezes mais rápido em passes forward e backward do que os modelos de attention padrão em contextos grandes. Ele utiliza FlashAttention em uma sub-sequência densa, garantindo eficiência e compatibilidade com melhorias existentes. Ao possibilitar o treinamento eficiente de modelos com contexto longo e manter a competência de um dense model, o Lighthouse Attention alcança um aumento de velocidade de 1.4x a 1.7x no pré-treinamento, enquanto reduz os custos computacionais.

O boom da IA criou uma divisão de riqueza, com cerca de 10.000 indivíduos de empresas como OpenAI e Nvidia atingindo mais de US$ 20 milhões em patrimônio, enquanto outros enfrentam futuros incertos com perspectivas de emprego estagnadas e demissões. Engenheiros de software expressam preocupações sobre a obsolescência de suas habilidades, aumentando a ansiedade sobre as carreiras. Essa disparidade alimenta a tensão no cenário tecnológico de São Francisco, enquanto alguns criticam o duplo papel da IA como fonte de riqueza e ameaça de carreira.

A OpenAI está desenvolvendo uma funcionalidade que permitirá ao seu agente de codificação, o Codex, operar aplicativos do macOS através do Computer Use, mesmo quando um laptop estiver bloqueado ou em modo de suspensão. Atualmente, o Computer Use requer uma sessão desbloqueada e ativa para visualizar a tela, mover o cursor e digitar. A remoção dessa restrição permitirá que os usuários direcionem seus agentes sem a necessidade de retornar fisicamente às suas máquinas para fazer login primeiro. A data de lançamento do recurso ainda não foi divulgada.

A portabilidade de kernel em IA é estruturalmente impossível porque o Pallas da TPU, o CuTile e o CUTLASS da NVIDIA, o NKI da AWS, o FlyDSL da AMD e o tt-Metalium da Tenstorrent expõem conceitos específicos de hardware que nenhuma DSL universal pode unificar. A evidência é que o MoE grouped matmul do MaxText é implementado em 282 linhas de Pallas na TPU, enquanto o equivalente do Flashinfer para Blackwell SM100 requer 4 milhões de linhas de CUDA gerado, sem código compartilhado, pois os próprios algoritmos divergem entre hardwares.

O Claude Code está sendo usado em produção em várias grandes bases de código em organizações com milhares de desenvolvedores. Esses ambientes apresentam desafios que bases de código menores não possuem. Este artigo aborda padrões que a Anthropic observou e que levaram à adoção bem-sucedida do Claude Code em escala, incluindo seu uso em monorepos com milhões de linhas, sistemas legados construídos ao longo de décadas e microservices em repositórios separados.

O tamanho do KV-cache, o tráfego de memória e o custo da attention rapidamente se tornam as principais restrições à medida que modelos de raciocínio e fluxos de trabalho de agentes mantêm mais tokens por mais tempo. Desenvolvedores de LLMs estão adicionando um número crescente de truques arquitetônicos para reduzir custos. A maioria das mudanças parece pequenos ajustes, mas algumas são alterações de design bastante intrincadas. Este artigo examina essas mudanças arquitetônicas com foco no que muda dentro do bloco transformer, residual stream, KV cache e computação de attention.

Os fundadores da Runway acreditam que a próxima forma de IA será construída a partir de modelos de vídeo e modelos de mundo que aprendem como o mundo funciona. A empresa está treinando modelos diretamente em dados de observação para alcançar a próxima fronteira da IA. A Runway foi uma das primeiras a desenvolver a geração de vídeo por IA, mas os modelos de mundo representam uma corrida diferente, com concorrentes de grande porte. A empresa já levantou US$ 860 milhões, mas está competindo contra grandes players como OpenAI e Google.

O Cursor detalhou um novo sistema para configurar ambientes de desenvolvimento baseados em cloud sob medida para agentes autônomos de programação. O sistema oferece suporte a multi-repositórios, configuração de ambiente como código, workflows automatizados de setup e controles de governança para gerenciar frotas de agentes paralelos.

Existem duas formas de criar sandbox para agentes que executam código: isolar a ferramenta ou isolar o agente. Agentes devem ter nada que valha a pena roubar e nada que valha a pena preservar. Isolar o agente requer um salto de rede adicional em cada operação e mais serviços para deploy, mas não há segredos para roubar, nenhum estado para preservar, e agentes podem ser mortos, reiniciados e escalados independentemente.

O Codex implementou hooks e tokens programáticos para facilitar a automação e customização de código. Os hooks permitem personalizar o loop do Codex com scripts que executam em pontos-chave de uma tarefa. O acesso programático fornece credenciais com escopo definido para equipes Business e Enterprise. Está disponível um vídeo mostrando como criar tokens de acesso para automações do Codex.

Genkit é um framework para construir aplicações full-stack com IA e agentic para qualquer plataforma. Suporta TypeScript, Go, Dart e Python. O Genkit usa hooks composáveis que interceptam chamadas de geração para implementar tentativas e fallbacks para máxima confiabilidade, aprovação humana antes de chamadas de ferramentas destrutivas, e observability em todas as camadas. Seu sistema de middleware executa um loop de ferramentas que se repete até o modelo terminar. O Genkit Developer pode ser usado para inspecionar, testar e debugar aplicações e execução de middleware.

Outras categorias