CEVIU IA
Todas as notícias

CEVIU IA

Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados

2332 notícias

O Claude Mythos Preview da Anthropic identificou autonomamente milhares de vulnerabilidades zero-day em grandes sistemas operacionais e navegadores. Este avanço é um pilar para o Project Glasswing, que, em parceria com grandes empresas de tecnologia, utiliza essas capacidades para aprimorar a cibersegurança, detectando e corrigindo vulnerabilidades em larga escala. A Anthropic planeja desenvolver salvaguardas e expandir a cooperação industrial para enfrentar os desafios de segurança na era da IA.

As Tensor Processing Units (TPUs) do Google são fundamentais para a infraestrutura de supercomputação da empresa. Os ASICs customizados da companhia impulsionam o treinamento e o serviço tanto para o Google quanto para seus clientes Cloud. TorchTPU é um stack que facilita o acesso da comunidade de IA a todas as capacidades das TPUs, fornecendo as APIs e as ferramentas necessárias para extrair o máximo de compute do hardware do Google. Esta publicação oferece uma análise aprofundada dos princípios de engenharia por trás do TorchTPU.

GLM-5.1 é um modelo carro-chefe para engenharia agentic, criado pela Z.ai, que alcança desempenho de ponta no SWE-Bench Pro. Ele foi desenvolvido para manter a eficácia em tarefas de agente em horizontes de tempo significativamente mais longos do que as gerações anteriores, sustentando a otimização por centenas de rodadas e milhares de chamadas de ferramentas. O modelo decompõe problemas complexos, executa experimentos, lê resultados e identifica impedimentos com precisão real.

O processo de Elon Musk contra a OpenAI deve ir a julgamento ainda este mês em Oakland, Califórnia. Musk alterou o processo para pedir que qualquer indenização que ele possa vir a receber seja concedida ao braço filantrópico da OpenAI, em vez de a si próprio. A emenda também solicita a remoção de Sam Altman, CEO da OpenAI, do conselho da entidade sem fins lucrativos da empresa. Musk busca mais de US$ 150 bilhões em indenizações tanto da OpenAI quanto da Microsoft. Ele alega que a OpenAI se desviou de sua missão sem fins lucrativos e o fraudou como doador ao se converter em uma empresa com fins lucrativos.

Modelos atuais de IA têm dificuldade em interpretar documentos financeiros complexos, especialmente na extração de dados visuais. GPT-5.4, Gemini 3.1 Pro e Claude Opus 4.6 falham consistentemente ao processar gráficos e imagens densas, atingindo apenas 56% a 64% de precisão, em comparação com 72% a 80% com entradas apenas textuais. Essas descobertas destacam lacunas significativas na capacidade da IA de realizar tarefas de raciocínio financeiro no mundo real, tornando prematura a substituição de analistas financeiros por IA.

A suíte Time Horizon da METR está sendo saturada. Modelos de IA de fronteira conseguem realizar de forma confiável quase todas as tarefas da suíte, exceto talvez uma dúzia, o que torna difícil estabelecer um limite superior para o seu horizonte temporal. A criação e avaliação de novos benchmarks estão se tornando mais caras. A situação provavelmente piorará à medida que o progresso da IA continuar. É provável que, até meados de 2027, nenhum resultado de benchmark de 2026 ou anterior seja capaz de descartar capacidades perigosas em sistemas de IA de fronteira.

Ryan Greenblatt, cientista-chefe da Redwood Research – uma organização de pesquisa com a missão de alinhar IAs super-humanas – compartilha neste artigo algumas de suas principais estimativas sobre o panorama atual da IA. O cenário previsto discute regulamentações de acesso a P&D, capacidades de engenharia e habilidades qualitativas, desalinhamento e propriedades relacionadas ao desalinhamento, ameaças cibernéticas, armas biológicas e efeitos econômicos. Algumas das afirmações apresentadas são altamente especulativas, enquanto outras possuem uma base mais sólida.

Este post detalha o agent harness, a infraestrutura de software completa que transforma um LLM em um agente orientado a objetivos e que utiliza ferramentas. Os harnesses de produção empregam memória em camadas, loops de verificação, orquestração de subagentes e execução estruturada de ferramentas para evitar perda de contexto, erros e falhas silenciosas. Frameworks como Claude Code, OpenAI Agents SDK e LangGraph demonstram que o design do harness pode, por si só, melhorar o desempenho do agente em mais de 20 posições, tornando-o a camada de engenharia crítica em torno de qualquer LLM.

A Mercor, uma plataforma de talentos com IA, conecta engenheiros de software, rotuladores de dados para IA e trabalhadores do conhecimento a empresas que buscam mão de obra contratada. Recentemente, a empresa alegou ter sofrido uma violação de dados devido a um ataque à cadeia de suprimentos em um popular pacote open source. Contudo, há diversas razões para questionar essa afirmação. É possível que a alegação de um ataque à cadeia de suprimentos seja uma tentativa de desviar a atenção de falhas de segurança mais profundas e embaraçosas.

A probabilidade de automação completa de P&D de IA até o final de 2028 aumentou quase duas vezes. O desempenho robusto em tarefas de engenharia de software (SWE) que são fáceis e baratas de verificar, e que não demandam novas ideias, permitirá que a IA acelere substancialmente a pesquisa e desenvolvimento em IA. Grande parte do trabalho de P&D em IA envolve esses tipos de tarefas, e a IA pode completá-las de forma significativamente mais barata e rápida do que humanos.

A OpenAI concluiu uma rodada de investimento de US$ 122 bilhões, com uma avaliação post-money de US$ 852 bilhões no final do mês passado. Desse montante, Amazon, Nvidia e SoftBank foram responsáveis por US$ 110 bilhões, enquanto os US$ 12 bilhões restantes vieram de um grupo mais amplo de investidores institucionais e individuais. Este artigo analisa os detalhes financeiros do acordo.Totalmente à parte dessa rodada, a OpenAI está negociando uma joint venture com várias empresas de private equity, avaliada em aproximadamente US$ 10 bilhões pre-money, com um retorno mínimo garantido de 17,5%, além de acesso antecipado aos modelos da OpenAI antes da disponibilidade geral.

A IA precisa se tornar uma camada de sistema operacional em todas as empresas, remodelando o desenvolvimento de produtos, a entrega de serviços e as operações internas. Essa abordagem envolve integrar a IA às funções centrais, em vez de tratá-la como uma mera funcionalidade. Empresas que não adotarem este modelo correm o risco de ineficiência e perda de vantagem competitiva, tornando a integração da IA crucial para atrair investimentos.

Alucinações de código são, em sua maioria, um problema de dados, causadas por dados de treinamento desatualizados ou fragmentados. A abordagem da Nia monta sites de documentação como virtual filesystems, permitindo que os agentes façam `grep`, `cat` e `tree` nos documentos em tempo real. Isso garante que eles codifiquem contra APIs atuais, e não `embeddings` obsoletos. Este `client-side`, `in-memory shell` funciona com Claude Code, Codex, Copilot, Gemini e OpenCode, oferecendo uma interface universal de baixa latência para agentes navegarem por informações estruturadas sem complexos `tool schemas` ou `container overhead`.

A OpenAI divulgou recentemente propostas de política para um mundo com IA que supera em muito as capacidades humanas. As propostas sugerem a criação de um sistema tributário centrado em IA, um fundo de investimento público focado em IA que poderia distribuir retornos regularmente aos americanos, e outras medidas. A OpenAI adotou a estratégia de IA do Presidente Trump, incluindo sua abordagem de mecanismos de proteção limitados para a indústria, mas ainda deseja cooperar com o resto do mundo na identificação e contenção de sistemas de IA perigosos. A empresa apoia dar ao governo um papel maior na avaliação de modelos.

Outras categorias