Atualizações direcionais no RLVR mostraram-se eficazes em identificar tokens críticos para raciocínio, permitindo extrapolação durante teste e reponderação durante o treinamento para aumentar a precisão.

CEVIU IA
Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados
2332 notícias
Lakewatch é uma plataforma SIEM que utiliza agentes de IA para detecção de ameaças, junto a aquisições da Antimatter e SiftD.ai para suportar implantações seguras de agentes.
Prithvi Rajasekaran, da Anthropic, desenvolveu uma arquitetura multi-agente para aprimorar o design de frontend orientado por IA e a codificação de aplicações full-stack. Inspirada por GANs, a abordagem utiliza agentes planejador, gerador e avaliador para decompor tarefas e garantir transições estruturadas, produzindo saídas complexas e de alta qualidade. Desafios persistem na gestão de contexto e ajuste do avaliador, indicando a necessidade de adaptar designs de harness à medida que os modelos de IA avançam.
A juíza distrital dos EUA Rita F. Lin, do Distrito Norte da Califórnia, afirmou durante uma audiência que o governo dos EUA parecia estar punindo a Anthropic ao proibir a empresa. A audiência faz parte dos esforços da Anthropic para aliviar a proibição governamental sobre o uso dos modelos de IA da empresa. Lin ainda não decidiu sobre o caso, mas expressou sérias dúvidas sobre as ações do governo Trump em seus comentários iniciais. A ação governamental já custou à Anthropic centenas de milhões de dólares em contratos cancelados e acordos abortados.
Em março, o Claude 4.6 traz uma janela de contexto de 1 milhão de tokens e quatro modos: Chat, Cowork, Code e Projects. A suíte Cowork automatiza workflows com Tarefas Agendadas e Conectores, e o ambiente Code utiliza hierarquia CLAUDE.md, protocolos MCP e Equipes de Agentes para desenvolvimento autônomo. Atualizações incluem pré-visualizações de pesquisa em Computer Use e Hooks deterministas para guardrails programáveis.
TurboQuant é um método de quantização que reduz a sobrecarga de memória de vetores, mantendo o desempenho. Isso melhora a eficiência do cache de chave-valor e acelera a busca de vetores.
A App Store foi a resposta centralizada para o problema de distribuição em uma nova plataforma computacional. Na era dos agentes, será necessária uma nova solução, pois os agentes precisam de APIs, não de lojas de aplicativos. A Apple garantiu sua receita obrigando que cada transação no aplicativo passasse pelo seu sistema de pagamento. A era dos agentes carece de mecânicas de bloqueio da Apple; assim, se uma plataforma decidir cobrar altas taxas de pagamento, os usuários simplesmente mudarão para um concorrente. Isso sugere que a camada de pagamento será competitiva e de baixa margem, em vez de monopolista. ️
O Ossature é um harness de código aberto para geração de código baseada em especificações. Os desenvolvedores escrevem especificações sobre o que o software deve fazer, e o Ossature as valida, utiliza um LLM para auditar ambiguidades e lacunas, produz um plano editável e, em seguida, gera código uma tarefa de cada vez, fornecendo apenas o contexto necessário para cada tarefa. Há verificação embutida no loop de construção. Se a verificação falhar, um agente solucionador tenta reparar o código a partir do erro reportado.
A Anthropic lançou o Auto Mode em prévia de pesquisa, permitindo que o Claude execute ações de forma autônoma com salvaguardas integradas que filtram comportamentos de risco e prompt injection.
As ferramentas para construir fábricas de software já existem. Os Minions da Stripe demonstram que o modelo funciona em larga escala. O papel do engenheiro de software está se transformando para algo semelhante ao de um operador de fábrica. Agora, desenvolvedores podem criar fábricas autoaperfeiçoadas que usam agentes para analisar feedbacks de usuários, testes A/B e dados de produção, preenchendo o backlog sem necessidade de curadoria humana.
O gasto com tokens não importa se as tarefas não são concluídas. A quantidade total de tokens consumidos por tarefa varia entre modelos. Uma empresa que cobra o dobro por tokens pode ainda ser a opção mais barata se seus modelos retornarem a resposta correta em menos interações. Em vez de usar o gasto com tokens como KPI, as empresas devem medir o custo por tarefa concluída com sucesso.
Claude executará tarefas agendadas via infraestrutura em nuvem, eliminando a necessidade de manter o Claude Code rodando em máquinas locais. ️
Empresas dependerão cada vez mais de agentes de IA, necessitando de world models para gerenciá-los eficientemente.
Startups de IA representaram 41% dos investimentos de venture capital na Carta no ano passado, com Anthropic, OpenAI e xAI captando financiamentos substanciais.
Modelos de IA de código aberto estão rapidamente fechando a diferença de desempenho com modelos de frontier, tornando o processamento local de IA cada vez mais viável e atraente.
Elon Musk anunciou o Terafab, uma empreitada de US$ 20 bilhões em parceria entre Tesla, SpaceX e xAI, destinada a construir a maior fábrica de chips do mundo, com o objetivo de gerar um terawatt de poder computacional anualmente. Localizada em Austin, Texas, a instalação produzirá chips para uso terrestre, como em carros autônomos, e no espaço, apoiando projetos como o proposto centro de dados orbital. Apesar das declarações ambiciosas de Musk, ele já não cumpriu totalmente em empreitadas passadas, como o Hyperloop e condução totalmente autônoma. ️
A Tencent lançou o ClawBot para integrar sua plataforma WeChat com o agente de IA OpenClaw, avançando no mercado chinês de agentes de IA. O ClawBot visa aprimorar os serviços de IA no WeChat, oferecendo aplicações para consumidores e negócios, o que pode aumentar o engajamento dos usuários. A iniciativa pode impactar as receitas da Tencent por meio de maior uso, pagamentos, publicidade e assinaturas, apesar dos desafios de concorrentes como Baidu e Alibaba.
Perplexity está adicionando uma seção de Pesquisa de Mercado, impulsionada por seu sistema multi-modelo agentic, Perplexity Computer.
'Tokenmaxxing' é um novo jogo de status onde trabalhadores obcecados por IA gastam tokens para provar sua produtividade . Algumas empresas incentivam a competição com rankings internos que mostram quantos tokens cada funcionário consome. Há desenvolvedores gastando milhares de dólares por mês para automatizar ao máximo seu trabalho. Um único agente pode gastar 700 milhões de tokens por semana. No entanto, esses rankings não revelam se eles estão realmente sendo produtivos ou se tudo é apenas teatro de produtividade .
O CEO da OpenAI, Sam Altman, tomou medidas extremas para garantir capacidade de compute em 2025, firmando acordos de infraestrutura bilionários. Enquanto a empresa se prepara para um possível IPO no final do ano, está começando a moderar expectativas e delinear uma estratégia mais comedida. A OpenAI percebe que o mercado não valoriza necessariamente sua abordagem anterior de crescimento e gastos.





