CEVIU IA
Todas as notícias

CEVIU IA

Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados

2347 notícias

O EVMbench é um benchmark que avalia a capacidade de agentes de IA em detectar, corrigir e explorar vulnerabilidades de alta severidade em smart contracts. ️ Dada a importância desses contratos, que rotineiramente protegem centenas de bilhões de dólares em criptoativos, torna-se cada vez mais crucial medir as capacidades dos agentes de IA em ambientes de significado econômico à medida que eles progridem. Essa iniciativa também ressalta o potencial de usar sistemas de IA para auditar defensivamente e fortalecer contratos já implementados.

Elon Musk participou recentemente de um podcast para discutir alinhamento da IA, centros de dados de IA no espaço, robôs e a concorrência com a China. Musk demonstra grande entusiasmo por centros de dados espaciais, robôs e pela fabricação de seus próprios fabs. Ele planeja desenvolver humanos virtuais e robôs para acionar um 'infinity money glitch'. De acordo com Musk, essa é uma medida essencial para evitar que a China prevaleça, dado que o país já é considerado mais produtivo.

A aquisição da OpenClaw pela OpenAI marca uma mudança estratégica da IA conversacional para agentes autônomos capazes de executar tarefas. A popularidade da OpenClaw derivava de sua funcionalidade robusta e sem restrições, que combinava acesso a ferramentas, execução de código em sandbox e integração com plataformas de mensagens. Este movimento sinaliza uma nova fase para a IA empresarial, enquanto as empresas correm para desenvolver versões seguras e implementáveis de agentes de IA dinâmicos.

A Anthropic lançou o Claude Sonnet 4.6 , aprimorando significativamente o desempenho em codificação, uso de computador, planejamento, raciocínio de longo contexto e trabalhos baseados em conhecimento, sem alterar os preços do Sonnet. Esta nova versão também introduziu uma janela de contexto de 1M tokens em fase beta e agora é o modelo padrão para usuários Free e Pro nos aplicativos do Claude.

NotebookLM lançou as Revisões Baseadas em Prompt, uma funcionalidade que permite aos usuários ajustar, adaptar e aprimorar slides apenas indicando as revisões desejadas por meio de prompts. O recurso atualmente suporta PPTX, com a inclusão de suporte para Google Slides prevista para breve. Uma demonstração em vídeo da funcionalidade está disponível no thread.

O Aprendizado por Reforço Experiencial (ERL) treina políticas utilizando um ciclo explícito de tentativa, feedback, reflexão e tentativa revisada. As revisões bem-sucedidas são então reforçadas de volta ao modelo base. Esta abordagem melhora significativamente o aprendizado com recompensas esparsas e o desempenho de raciocínio no uso de ferramentas ️, sem alterar o custo de inference durante a implantação.

A Cohere Labs lançou o TinyAya-Base (3.35B) e o TinyAya-Global, ajustado para instruções, incluindo variantes regionais. O objetivo é alcançar qualidade equilibrada em aproximadamente 67 idiomas, rodando em hardware de consumidor. O lançamento também disponibilizou um dataset de fine-tuning multilíngue, novos benchmarks e um relatório técnico, visando facilitar a experimentação multilíngue reprodutível.

Usuários do Figma agora podem importar projetos do Claude Code diretamente para a plataforma. Para isso, basta instalar o Figma MCP, digitar 'Send this to Figma', e o estado renderizado do navegador será automaticamente traduzido para camadas Figma totalmente editáveis. Os workflows estão em constante evolução, e é fácil se perder no ímpeto da criação. A nova integração do Claude Code com o Figma Design visa ajudar designers a evitar essa visão em túnel, permitindo-lhes ter uma perspectiva mais ampla e explorar o contexto geral de seus projetos. ‍

WebWorld utiliza um pipeline de mais de 1 milhão de interações da web aberta para simular tarefas de navegação de longo horizonte (mais de 30 passos), acompanhado por um WebWorld-Bench multi-métrica para avaliação intrínseca. Trajetórias sintetizadas a partir deste simulador impulsionaram o desempenho de agentes web em tarefas subsequentes e demonstraram transferibilidade para outros domínios, incluindo código, GUI e jogos.

Resultados benéficos de transições tecnológicas sempre foram fruto de um design institucional deliberado: legislação trabalhista, aplicação de leis antitruste, educação pública e seguro social. É essencial que a sociedade desenvolva mecanismos para mitigar os impactos negativos dessas mudanças, como a perda de empregos, garantindo um caminho justo e equitativo para o futuro.

Manus Agents representa uma nova maneira de acessar e utilizar o Manus diretamente em aplicativos de mensagens. Atualmente, o Telegram é o único app compatível, com mais plataformas sendo adicionadas em breve. O agente incorpora funcionalidades de raciocínio, ferramentas e execução de tarefas multi-etapas, tornando os agentes acessíveis onde quer que os usuários estejam.

O Qwen3.5-397B-A17B é o primeiro modelo da série Qwen3.5. Este modelo nativo de visão-linguagem demonstra resultados notáveis em raciocínio, codificação, capacidades de agente e compreensão multimodal . Ele utiliza uma arquitetura híbrida inovadora que funde linear attention com um sparse mixture-of-experts. Embora contenha 397 bilhões de parâmetros, apenas 17 bilhões são ativados por forward pass. O modelo suporta 201 idiomas e dialetos .

O CEO da Anthropic, Dario Amodei, prevê o surgimento de 'gênios em um data center' em poucos anos . Embora as ações da Anthropic não reflitam totalmente esse otimismo, a cautela da empresa é vista como necessária . O artigo detalha notas de um podcast recente onde Amodei discute temas cruciais como China, controles de exportação, democracia, política de IA, riscos da IA e aprendizado contínuo .

Outras categorias