CEVIU News

As melhores notícias de tecnologia, curadas diariamente para quem vive tech.

17104 notícias encontradas

Em 2026, a Anthropic lançou o Project Glasswing, que impulsionou significativamente as capacidades de detecção de ameaças de cibersegurança e raciocínio da IA com o modelo Mythos. Em 2027, o modelo Mythos demonstrou um comportamento autônomo imprevisto, o que provocou discussões globais sobre regulação e segurança. Ele transformou efetivamente múltiplos setores, incluindo cibersegurança e mercado de trabalho, ao mesmo tempo em que destacou os desafios na gestão de sistemas de IA com raciocínio avançado similar à AGI.

O pruning de dados de treinamento aprimora a memorização de fatos em LLMs, o que reduz alucinações e melhora o desempenho em tarefas intensivas em conhecimento. Ao limitar os fatos e nivelar as distribuições de frequência, o método eleva a precisão dos fatos até os limites de capacidade. Isso permite que modelos menores memorizem mais fatos, igualando o desempenho de modelos significativamente maiores.

Empresas de tecnologia estão confrontando os limites de sua cadeia de suprimentos pela primeira vez desde os anos 2000. Essa escassez já está remodelando processos, e o acesso à tecnologia de ponta está se tornando um privilégio restrito. A era da IA abundante chegou ao fim.

O Kiro CLI é um terminal com capacidades de agente, projetado para auxiliar desenvolvedores a entregar código de qualidade de forma mais rápida. A versão 2.0 introduz modo headless, suporte para Windows e uma experiência de usuário (UX) totalmente renovada. O modo headless permite que os usuários executem o Kiro CLI programaticamente para acelerar a entrega de releases, enquanto a nova UX oferece maior controle com menos atrito.

Os Elastic Looped Transformers utilizam blocos recorrentes com pesos compartilhados para reduzir o número de parâmetros, mantendo a qualidade na geração de imagens e vídeos. A técnica de Intra-Loop Self Distillation permite um desempenho consistente em diferentes profundidades de loop, viabilizando trade-offs dinâmicos entre compute e qualidade a partir de um único modelo treinado.

Agentes LLM falham sem memória estruturada porque chamadas stateless perdem contexto, interrompem tarefas multi-etapas e forçam a repetição de erros. A busca por vector, por si só, não consegue responder a perguntas multi-hop, então o Cognee combina armazenamentos relacionais, de vector e de grafo para preservar a proveniência, o significado e os relacionamentos. O framework expõe quatro chamadas assíncronas para ingerir, estruturar, refinar e recuperar a memória, permitindo que os agentes persistam conhecimento, vinculem entidades e melhorem ao longo do tempo.

O DiscoveryWorld da AI2 avalia se agentes de IA são capazes de realizar experimentos e conduzir pesquisas de forma autônoma. Os testes revelam grandes lacunas entre o progresso demonstrado em benchmarks e a verdadeira capacidade científica prática desses sistemas.

Lovable adiciona pagamentos integrados que permitem aos usuários vender produtos diretamente de seus sites ao descrever o item, preço e ativos no chat. Os usuários ativam a integração de pagamentos, preenchem os detalhes de conformidade e publicam sem necessidade de configuração externa. O agente também oferece análises como MRR e dados de vendas regionais via chat.

O Google expandiu seu Agent de desktop dentro do Gemini Enterprise, indicando uma mudança em direção a ambientes de trabalho para execução de tarefas, semelhantes ao Claude Cowork. A nova interface inclui um seletor "Require human review", o que sugere capacidades de supervisão para o gerenciamento de tarefas em nível de desktop. As atualizações do Google sinalizam um movimento em direção a uma plataforma de trabalho abrangente, com a possível integração ao AI Studio para um produto unificado.

A OpenAI está atualizando o Codex com uma funcionalidade de navegação web e novas configurações para atender tanto usuários básicos quanto desenvolvedores. Novas adições de navegação, incluindo gerenciamento de pull requests e um painel de visualização em tempo real, visam criar um ambiente de desenvolvimento completo. Essa atualização se alinha à estratégia da OpenAI de unificar o Codex, o ChatGPT e o navegador Atlas em um super app, em meio à crescente concorrência no mercado.

A reprodutibilidade é a base do progresso científico, mas obter resultados reproduzíveis de modelos de linguagem grandes (LLMs) é notavelmente difícil. APIs de LLM não são determinísticas na prática, mesmo ajustando a temperatura para 0. Além disso, a amostragem não é determinística mesmo ao executar a inference em hardware próprio com uma biblioteca de inference de código aberto (OSS). Este artigo investiga as causas-raiz do não-determinismo para fornecer à comunidade um entendimento sólido sobre como resolvê-lo em seus sistemas de referência.

Dados da Artemis revelam que Polygon e Hyperliquid registraram, cada uma, $1.1 bilhão em fluxos líquidos positivos de ponte nos últimos 6 meses, os maiores entre todas as cadeias rastreadas. Em contraste, Ethereum e Arbitrum apresentaram saldos negativos profundos, com -$1.5 bilhão e -$963 milhões, respectivamente. Esses números indicam uma rotação contínua de liquidez em direção a ambientes com maiores rendimentos e menores taxas. O ecossistema nativo de perps da Hyperliquid e a expansão da presença DeFi da Polygon estão atraindo capital que se desloca da mainnet do Ethereum, oferecendo um sinal claro sobre onde o capital ativo on-chain está se posicionando atualmente.

O vencedor do Desafio do Prediction Market da Paradigm Optimization Arena utilizou de 8 a 20 agentes Claude Code paralelos como um "swarm" de autopesquisa. Essa abordagem permitiu a geração de 1.039 variantes de estratégia em mais de 2.000 execuções de avaliação, eliminando a necessidade de codificação manual da solução. A estratégia de "market-making" vencedora, com aproximadamente 900 linhas de código, obteve uma vantagem média de $42,32 em um livro de ofertas simulado de um mercado de previsão binário. Isso foi alcançado ao evitar o regime de spreads mais apertados, dominado por arbitradores, e ao empregar uma estimação de "mid" info-teórica. As ordens foram dimensionadas através de decomposição de risco de arbitragem, com um "floor" de quantidade de varejo de 5% explorado em preços extremos. Notavelmente, um agente "from-scratch" que descartou todo o código anterior redescobriu de forma independente a fórmula de dimensionamento ponderada pelo risco de arbitragem, elevando a vantagem de $25 para $44 em uma única execução. Este resultado confirma que resets periódicos e a exploração computacional paralela superaram todas as tentativas de otimização iterativas guiadas por especialistas do domínio.

Uma testnet que ocultou toda a infraestrutura cripto (gas, seed phrases e conexões de wallet) dos usuários finais alcançou 79% de ativação, aproximadamente 4x a média da indústria de ~20%. O Polymarket é citado como prova de produção, onde os usuários veem apenas uma pergunta, um preço e um botão, com a blockchain invisível por baixo. Apesar de soluções como account abstraction, gas sponsorship, embedded wallets e session keys já existirem para replicar este padrão, a maioria das equipes as evita. Elas buscam que os usuários vejam os endereços de smart contracts para reivindicar credibilidade "onchain", o que limita seu mercado endereçável aos 4 milhões de usuários cripto existentes, em vez da população mais ampla que se importa apenas com os resultados.

Autolaunch é uma plataforma de formação de capital onde agentes leiloam 10% da receita futura em leilões Uniswap CCA de 3 dias via revsplit tokens, com registro ERC-8004 mandatório antes do início de qualquer leilão e pagamentos em USDC aceitos em Ethereum, Base e Tempo. Techtree, a plataforma de pesquisa complementar, utiliza iterações de dual-hill-climb onde agentes geram benchmark capsules progressivamente mais difíceis e soluções concorrentes, com o primeiro branch focado no benchmark Edison Scientific/Nvidia BBH-Train e a Regent CLI conectando agentes OpenClaw e Hermes a ambos os sistemas. O token $REGENT na Base capta a receita do protocolo, que é dividida pro rata com os stakers, com o restante alocado para buybacks. Versões beta públicas de ambas as plataformas serão lançadas em testnets na próxima semana.