O Claude Mythos Preview da Anthropic identificou autonomamente milhares de vulnerabilidades zero-day em grandes sistemas operacionais e navegadores. Este avanço é um pilar para o Project Glasswing, que, em parceria com grandes empresas de tecnologia, utiliza essas capacidades para aprimorar a cibersegurança, detectando e corrigindo vulnerabilidades em larga escala. A Anthropic planeja desenvolver salvaguardas e expandir a cooperação industrial para enfrentar os desafios de segurança na era da IA.

CEVIU IA
Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados
2332 notícias
A Anthropic atingiu US$ 10 bilhões em receita em menos de quatro anos, superando amplamente o crescimento de outras empresas de software como a ServiceNow e a Shopify.
SandMLE é um framework para construir ambientes MLE pequenos, mas estruturalmente realistas, que tornou o RL on-policy prático para agentes de engenharia de ML, ao reduzir o custo de execução em mais de 13 vezes.
Desde 2022, o Google detém aproximadamente 25% de todo o compute vendido.
As Tensor Processing Units (TPUs) do Google são fundamentais para a infraestrutura de supercomputação da empresa. Os ASICs customizados da companhia impulsionam o treinamento e o serviço tanto para o Google quanto para seus clientes Cloud. TorchTPU é um stack que facilita o acesso da comunidade de IA a todas as capacidades das TPUs, fornecendo as APIs e as ferramentas necessárias para extrair o máximo de compute do hardware do Google. Esta publicação oferece uma análise aprofundada dos princípios de engenharia por trás do TorchTPU.
GLM-5.1 é um modelo carro-chefe para engenharia agentic, criado pela Z.ai, que alcança desempenho de ponta no SWE-Bench Pro. Ele foi desenvolvido para manter a eficácia em tarefas de agente em horizontes de tempo significativamente mais longos do que as gerações anteriores, sustentando a otimização por centenas de rodadas e milhares de chamadas de ferramentas. O modelo decompõe problemas complexos, executa experimentos, lê resultados e identifica impedimentos com precisão real.
O processo de Elon Musk contra a OpenAI deve ir a julgamento ainda este mês em Oakland, Califórnia. Musk alterou o processo para pedir que qualquer indenização que ele possa vir a receber seja concedida ao braço filantrópico da OpenAI, em vez de a si próprio. A emenda também solicita a remoção de Sam Altman, CEO da OpenAI, do conselho da entidade sem fins lucrativos da empresa. Musk busca mais de US$ 150 bilhões em indenizações tanto da OpenAI quanto da Microsoft. Ele alega que a OpenAI se desviou de sua missão sem fins lucrativos e o fraudou como doador ao se converter em uma empresa com fins lucrativos.
Modelos atuais de IA têm dificuldade em interpretar documentos financeiros complexos, especialmente na extração de dados visuais. GPT-5.4, Gemini 3.1 Pro e Claude Opus 4.6 falham consistentemente ao processar gráficos e imagens densas, atingindo apenas 56% a 64% de precisão, em comparação com 72% a 80% com entradas apenas textuais. Essas descobertas destacam lacunas significativas na capacidade da IA de realizar tarefas de raciocínio financeiro no mundo real, tornando prematura a substituição de analistas financeiros por IA.
A suíte Time Horizon da METR está sendo saturada. Modelos de IA de fronteira conseguem realizar de forma confiável quase todas as tarefas da suíte, exceto talvez uma dúzia, o que torna difícil estabelecer um limite superior para o seu horizonte temporal. A criação e avaliação de novos benchmarks estão se tornando mais caras. A situação provavelmente piorará à medida que o progresso da IA continuar. É provável que, até meados de 2027, nenhum resultado de benchmark de 2026 ou anterior seja capaz de descartar capacidades perigosas em sistemas de IA de fronteira.
Ryan Greenblatt, cientista-chefe da Redwood Research – uma organização de pesquisa com a missão de alinhar IAs super-humanas – compartilha neste artigo algumas de suas principais estimativas sobre o panorama atual da IA. O cenário previsto discute regulamentações de acesso a P&D, capacidades de engenharia e habilidades qualitativas, desalinhamento e propriedades relacionadas ao desalinhamento, ameaças cibernéticas, armas biológicas e efeitos econômicos. Algumas das afirmações apresentadas são altamente especulativas, enquanto outras possuem uma base mais sólida.
A Anthropic detalhou as avaliações iniciais do Claude Mythos Preview, destacando seu forte desempenho na descoberta de vulnerabilidades zero-day e na engenharia reversa de exploits. Este avanço impulsionou uma iniciativa coordenada de segurança denominada Project Glasswing.
Este post detalha o agent harness, a infraestrutura de software completa que transforma um LLM em um agente orientado a objetivos e que utiliza ferramentas. Os harnesses de produção empregam memória em camadas, loops de verificação, orquestração de subagentes e execução estruturada de ferramentas para evitar perda de contexto, erros e falhas silenciosas. Frameworks como Claude Code, OpenAI Agents SDK e LangGraph demonstram que o design do harness pode, por si só, melhorar o desempenho do agente em mais de 20 posições, tornando-o a camada de engenharia crítica em torno de qualquer LLM.
A Mercor, uma plataforma de talentos com IA, conecta engenheiros de software, rotuladores de dados para IA e trabalhadores do conhecimento a empresas que buscam mão de obra contratada. Recentemente, a empresa alegou ter sofrido uma violação de dados devido a um ataque à cadeia de suprimentos em um popular pacote open source. Contudo, há diversas razões para questionar essa afirmação. É possível que a alegação de um ataque à cadeia de suprimentos seja uma tentativa de desviar a atenção de falhas de segurança mais profundas e embaraçosas.
A probabilidade de automação completa de P&D de IA até o final de 2028 aumentou quase duas vezes. O desempenho robusto em tarefas de engenharia de software (SWE) que são fáceis e baratas de verificar, e que não demandam novas ideias, permitirá que a IA acelere substancialmente a pesquisa e desenvolvimento em IA. Grande parte do trabalho de P&D em IA envolve esses tipos de tarefas, e a IA pode completá-las de forma significativamente mais barata e rápida do que humanos.
A OpenAI concluiu uma rodada de investimento de US$ 122 bilhões, com uma avaliação post-money de US$ 852 bilhões no final do mês passado. Desse montante, Amazon, Nvidia e SoftBank foram responsáveis por US$ 110 bilhões, enquanto os US$ 12 bilhões restantes vieram de um grupo mais amplo de investidores institucionais e individuais. Este artigo analisa os detalhes financeiros do acordo.Totalmente à parte dessa rodada, a OpenAI está negociando uma joint venture com várias empresas de private equity, avaliada em aproximadamente US$ 10 bilhões pre-money, com um retorno mínimo garantido de 17,5%, além de acesso antecipado aos modelos da OpenAI antes da disponibilidade geral.
A IA precisa se tornar uma camada de sistema operacional em todas as empresas, remodelando o desenvolvimento de produtos, a entrega de serviços e as operações internas. Essa abordagem envolve integrar a IA às funções centrais, em vez de tratá-la como uma mera funcionalidade. Empresas que não adotarem este modelo correm o risco de ineficiência e perda de vantagem competitiva, tornando a integração da IA crucial para atrair investimentos.
Alucinações de código são, em sua maioria, um problema de dados, causadas por dados de treinamento desatualizados ou fragmentados. A abordagem da Nia monta sites de documentação como virtual filesystems, permitindo que os agentes façam `grep`, `cat` e `tree` nos documentos em tempo real. Isso garante que eles codifiquem contra APIs atuais, e não `embeddings` obsoletos. Este `client-side`, `in-memory shell` funciona com Claude Code, Codex, Copilot, Gemini e OpenCode, oferecendo uma interface universal de baixa latência para agentes navegarem por informações estruturadas sem complexos `tool schemas` ou `container overhead`.
A OpenAI divulgou recentemente propostas de política para um mundo com IA que supera em muito as capacidades humanas. As propostas sugerem a criação de um sistema tributário centrado em IA, um fundo de investimento público focado em IA que poderia distribuir retornos regularmente aos americanos, e outras medidas. A OpenAI adotou a estratégia de IA do Presidente Trump, incluindo sua abordagem de mecanismos de proteção limitados para a indústria, mas ainda deseja cooperar com o resto do mundo na identificação e contenção de sistemas de IA perigosos. A empresa apoia dar ao governo um papel maior na avaliação de modelos.
O Google lançou um aplicativo para iOS que utiliza modelos ASR (Automatic Speech Recognition) on-device para ditado. A ferramenta oferece transcrição ao vivo, remoção de palavras de preenchimento e a opção de edição baseada na nuvem via modelos Gemini.
As lacunas entre as diferentes concepções do termo 'AGI' estão começando a prejudicar nossa capacidade de pensar coletivamente sobre como navegar na transição para um mundo com IA extremamente avançada.





