A Vercel tornou open-source o deepsec, um mecanismo de segurança impulsionado por agentes de codificação que executa localmente (ou distribui para mais de 1.000 Vercel Sandboxes para paralelismo). Ele encadeia etapas de varredura → investigação → revalidação → enriquecimento → exportação para identificar vulnerabilidades em grandes bases de código, utilizando Claude Opus 4.7 em esforço máximo e GPT-5.5 com raciocínio de alta precisão via assinaturas existentes do Claude ou Codex. O fluxo de trabalho inicia com análise estática baseada em regex para sinalizar arquivos sensíveis à segurança. Em seguida, agentes rastreiam fluxos de dados e verificam mitigações, com uma etapa de revalidação de segunda passagem para eliminar falsos positivos (a Vercel relata uma taxa de FP de 10-20%) e um sistema de plugins para matchers de regex personalizados ajustados ao modelo de autenticação ou camada de dados de uma equipe. É mais adequado para aplicações e serviços do que para bibliotecas.
CEVIU News
As melhores notícias de tecnologia, curadas diariamente para quem vive tech.
16434 notícias encontradas
A Mozilla utilizou o modelo de IA Mythos da Anthropic para identificar 271 falhas de segurança no Firefox em apenas dois meses. Essa conquista foi possível graças a um harness customizado que encapsula o LLM, concede acesso às ferramentas de build do Firefox e o executa em um loop com sinais claros de sucesso. Ao analisar o código em busca de problemas de memory safety, o Mythos cria casos de teste contra o build de sanitizer do Firefox. Se ocorrer uma falha, um segundo LLM é acionado para verificar a descoberta. Das 271 falhas, 180 foram classificadas como sec-high (exploráveis por navegação normal), 80 como sec-moderate e 11 como sec-low.
A Meta removeu a opção de DMs de Instagram com criptografia de ponta a ponta devido à baixa adesão, direcionando os usuários para o WhatsApp. Grupos de proteção à criança haviam se oposto a uma criptografia mais ampla, enquanto grupos de privacidade e a Proton alertam que os usuários agora enfrentam maior exposição e um tratamento incerto de conversas criptografadas anteriores. A Meta já utiliza interações privadas de IA para direcionamento de anúncios e não descartou o uso semelhante das mensagens do Instagram.
Ferramentas poderosas como o Mythos da Anthropic permitirão que pesquisadores de segurança escalem suas operações para descobrir novas vulnerabilidades, trabalhando em conjunto com a IA. No entanto, a gestão de vulnerabilidades nunca foi sobre encontrar falhas, mas sim sobre corrigi-las, e o tooling atual de IA apresenta defasagem nesse aspecto. A modelagem de ameaças é uma área onde o tooling de IA se destaca, e as equipes de segurança devem aproveitá-lo.
A Agência de Segurança Interna da Polônia detectou ataques em cinco estações de tratamento de água, onde hackers assumiram o controle de equipamentos industriais e poderiam comprometer a safety da água.
As autoridades alemãs (BKA, ZIT e a Procuradoria Pública de Frankfurt) desmantelaram uma versão reaberta do marketplace de cibercrime Crimenetwork. A plataforma havia acumulado 22.000 usuários, mais de 100 vendedores e gerado uma receita de pelo menos €3,6 milhões (US$4,2 milhões).
A OpenAI assegura a operação segura do Codex por meio de ambientes controlados, aplicação de sandboxing e rigorosas políticas de aprovação. Essas medidas visam garantir a integridade e a segurança do modelo, mitigando riscos em seu uso e desenvolvimento.
Grandes laboratórios estão direcionando seus modelos para um número limitado de casos de uso, ao mesmo tempo em que treinam seus designs de harness nos modelos. Isso os torna menos generalizados, o que pode facilitar a construção de aplicações para algumas empresas, mas o compromisso resultante é o lock-in.
Este post contém um guia sobre hardware para inferência local de LLMs.
O ChatGPT 5.5 Pro demonstrou ser capaz de produzir uma pesquisa de nível de doutorado em aproximadamente uma hora, sem exigir contribuição matemática substancial de um ser humano. Inicialmente, as afirmações de que os LLMs poderiam resolver problemas de pesquisa eram recebidas com ceticismo, visto que muitas das soluções já estavam disponíveis na literatura ou eram facilmente dedutíveis. No entanto, a situação evoluiu para um ponto onde, se um problema apresentar um argumento direto que, por algum motivo, matemáticos humanos não identificaram, existe uma boa probabilidade de que os LLMs o detectem. Esta publicação examina o desempenho do ChatGPT 5.5 Pro diante de uma série de problemas selecionados.
A Allen AI lançou o EMO, um modelo Mixture-of-Experts que aprende a organização modular dos especialistas diretamente dos dados de pré-treinamento, em vez de domínios predefinidos. Tarefas podem ser executadas utilizando apenas 12,5% dos especialistas, mantendo um desempenho próximo ao do modelo completo.
SkillOS introduziu um framework de aprendizado por reforço que treina agentes para curar skills reutilizáveis a partir de experiências passadas. O sistema aprimorou o desempenho em tarefas de longo prazo ao evoluir repositórios de skills estruturados que se generalizam entre modelos e domínios.
Diferentes métodos de pós-treinamento, como SFT, RL e On-Policy Distillation, remodelam a distribuição de um modelo de maneiras distintas, impactando o desempenho e o risco de catastrophic forgetting. A RL atualiza políticas usando recompensas de amostras da política atual, promovendo o desempenho da tarefa enquanto minimiza o esquecimento, ao contrário do SFT, que tende a puxar para dados externos, arriscando as capacidades existentes. Experimentos demonstram que o On-Policy Distillation pode superar seus teachers, sugerindo que a amostragem de dados on-policy preserva crucialmente as capacidades, tornando-a um ingrediente chave para futuros designs de algoritmos.
Um guia de engenharia da OpenAI para a construção de sistemas de tradução de fala ao vivo, utilizando o gpt-realtime-translate. Este modelo foi otimizado especificamente para interpretação simultânea, diferenciando-se de interações de voz baseadas em turnos.
A singularidade descreve um mundo onde uma única IA superinteligente impõe ordem ao universo. A anti-singularidade, por outro lado, é um cenário onde quase todos os sistemas são caracterizados por um conjunto complexo de interações que só podem ser compreendidas por meio de tentativa e erro. Nesse mundo de anti-singularidade, o fato de a IA poder testar milhões de possibilidades no tempo que um humano levaria para tentar uma única vez a tornará extremamente poderosa. Esse futuro será repleto de uma série infinita de desafios novos e únicos, aos quais teremos que nos adaptar ou evoluir em resposta.
A Nvidia já realizou mais de US$ 40 bilhões em investimentos este ano, consolidando-se como a maior vencedora do boom da IA até agora. A corrida global para garantir GPUs impulsionou as ações da empresa em mais de 11 vezes nos últimos quatro anos. Para assegurar sua dominância para além dos chips, a empresa está financiando toda a cadeia de suprimentos de IA, garantindo que ela opere com hardware Nvidia.
O Google lançou o Gemini 3.1 Flash-Lite, agora acessível globalmente via Google Cloud. Desenvolvido para latência ultrabaixa e tarefas de alto volume, este modelo é direcionado a setores como engenharia de software e serviços financeiros, oferecendo tempos de resposta sub-segundo e mantendo a latência p95 em torno de 1.8 segundos. O Gemini 3.1 proporciona velocidade, custo e desempenho cognitivo aprimorados, com suporte a tarefas multimodais, tornando-o ideal para operações de desenvolvedores e atendimento ao cliente em tempo real.
A Akamai garantiu a Anthropic como cliente, com a Anthropic se comprometendo a gastar US$ 1,8 bilhão nos serviços da Akamai ao longo de sete anos. A Anthropic tem se esforçado para aumentar sua capacidade de compute devido a reclamações generalizadas sobre os limites de uso do Claude. Somente neste mês, a Anthropic fechou ou expandiu acordos com CoreWeave, Amazon, Google, Broadcom e xAI.
Atualizações de agentes nem sempre tornam as memórias mais úteis. Na verdade, elas podem fazer com que os agentes performem pior do que o mesmo modelo sem memória alguma. A falha reside na etapa de reescrita. Até que os agentes possam decidir quando e como consolidar, a opção padrão mais segura é manter a memória episódica e abstrair com moderação, ou não abstrair de forma alguma.
As ferramentas de IA amadureceram o suficiente para construir sistemas reais que se consolidam. Esta publicação revela como a IA pessoal realmente se parece quando se deixa de tratá-la como uma janela de chat e se passa a encará-la como um sistema operacional. Tudo o que é descrito no artigo é open source e gratuito no GitHub.
