O olmo-eval é uma ferramenta desenvolvida para facilitar o processo de avaliação contínua durante o ciclo de desenvolvimento de modelos de IA, permitindo uma análise mais eficiente no loop de experimentação.
CEVIU News
As melhores notícias de tecnologia, curadas diariamente para quem vive tech.
15504 notícias encontradas
O sistema Security Insights da Cloudflare agora processa mais de 120 varreduras por segundo, fornecendo dados frequentes para todos os clientes. Ao otimizar consumidores de Kafka, queries de Postgres e a API, a empresa escalou seu throughput em 10 vezes sem a necessidade de hardware adicional.
A Anthropic decidiu tornar visíveis as suas salvaguardas para o desenvolvimento de LLMs de fronteira após sofrer críticas de pesquisadores. Anteriormente, a empresa redirecionava discretamente solicitações para um modelo inferior quando este era requisitado para executar tarefas específicas. Pesquisadores descobriram que o Claude estava recusando ou degradando respostas para tarefas como o treinamento de modelos concorrentes, debugging de código de IA e otimização de arquitetura neural. O caso gerou preocupações sobre a falta de transparência da Anthropic e o desperdício de tokens e recursos computacionais em modelos que não entregavam o desempenho esperado.
Este artigo descreve como um desenvolvedor criou seu próprio LLM do zero. O relato detalha a construção dos scripts de base-training e fine-tuning, além dos pipelines de processamento de dados e do dataset personalizado. O custo total do projeto foi de aproximadamente 80 dólares, contando com o uso de um PC próprio para o processamento dos dados. O código e o modelo resultante estão disponíveis na publicação.
O debugging de dados preditivo identifica comportamentos potenciais de um modelo antes do treinamento, por meio da análise de datasets de preferência. Essa técnica, integrada à plataforma Silico, permite que engenheiros reformulem datasets ou processos de treinamento para prevenir efeitos indesejados, aprimorando o desempenho e a segurança. Estudos de caso revelam problemas comuns, como guardrails de safety comprometidos, alucinação de links e sycophancy específica ao contexto, permitindo intervenções direcionadas para corrigir falhas antes do deployment.
O sistema automatizado de pesquisa em IA da Recursive alcançou resultados de estado da arte em treinamento de modelos de linguagem com orçamento fixo, velocidade de modelos pequenos e otimização de kernel de GPU.
O MiMo Code V0.1.0 é um assistente de codificação IA open source focado em terminal desenvolvido pela Xiaomi. A ferramenta supera o Claude Code em benchmarks de codificação agentic, apresentando desempenho superior especialmente em tarefas de longo horizonte com múltiplas etapas. O sistema inclui um mecanismo de memória entre sessões que utiliza um subagente independente para registrar decisões, problemas e o escopo do projeto ao longo da execução. O modelo já está disponível no GitHub sob licença MIT.
O cofundador da CoreWeave, Brannin McBee, argumentou recentemente que o compute não é fungível da maneira que uma commodity exige. Embora ele apresente um argumento válido, essa estruturação de não-commodity é a peça central do valor de sua empresa. Ao sugerir a ausência de um mercado, ele na verdade está precificando o setor e revelando onde as margens de lucro ainda estão ocultas.
Modelos de IA frontier são geralmente treinados em sequências de números inteiros conhecidas como tokens. Cada token refere-se a uma sequência de bytes, que frequentemente corresponde a palavras comuns. Esta publicação apresenta um algoritmo capaz de computar um tokenizer ótimo em determinados cenários.
A Oracle comunicou aos investidores a expectativa de um aumento de capital adicional de 20 bilhões de dólares e reportou um fluxo de caixa livre negativo para o ano. Embora a receita tenha crescido no quarto trimestre fiscal, a expansão da infraestrutura de IA elevou os gastos de capital em 162%, totalizando 55,7 bilhões de dólares. O mercado reagiu negativamente à magnitude desses investimentos, gerando incertezas sobre a capacidade da empresa em converter esses gastos em crescimento de lucro.
O desempenho dos modelos de IA tem melhorado continuamente sem sinais de estagnação. Atualmente, modelos com pesos abertos estão apenas alguns meses atrás dos frontier models em termos de benchmarks. Se a tendência atual persistir, é provável que, até o início de 2029, seja possível rodar um modelo aberto com capacidade equivalente ao Claude Fable 5 em dispositivos equipados com 16 GB de RAM.
As margens brutas de lucro em modelos de assinatura são significativamente inferiores às obtidas via API. Por conta disso, a tendência é que os laboratórios de IA comecem a restringir o acesso a novos recursos ou modelos em seus planos de assinatura.
A OpenAI planeja adquirir a Ona para expandir o Codex com ambientes de cloud seguros e persistentes, permitindo a execução de agentes de IA de longa duração em fluxos de trabalho corporativos.
O artigo aborda o processo de profiling no PyTorch, detalhando a transição de um componente nn.Linear padrão para a implementação de um MLP com técnica de fusion.
A Doyensec realizou um teste comparativo entre o Attack AI Pentest da Aikido e o Lightspeed da XBOW utilizando duas aplicações web open source, validando manualmente cada descoberta. A Aikido identificou mais verdadeiros positivos e apresentou uma configuração rápida, embora o XBOW tenha obtido uma proporção ligeiramente melhor de falsos positivos. O XBOW, contudo, enfrentou falhas durante a execução, incluindo travamentos e exclusão de contas de teste, além de limitações em credenciais administrativas que podem ter ocultado vulnerabilidades de autorização. Ambas as soluções superaram ferramentas tradicionais de SAST/DAST em termos de ROI, mas apresentaram uma tendência comum de superestimar a severidade das falhas encontradas.
O Claude Fable 5 foi lançado no Amazon Bedrock, oferecendo desempenho de nível Mythos em tarefas de longa duração e visão computacional. Contudo, o acesso requer a adesão obrigatória à retenção de dados por 30 dias e a permissão para que os dados de inference saiam do limite de segurança da AWS para processos de detecção de uso indevido pela Anthropic.
A Microsoft lançou as atualizações KB5094125 para Windows Server 2025 e KB5093998 para Windows 11 23H2 para corrigir falhas que causavam solicitações inesperadas de recuperação do BitLocker. O problema era disparado após atualizações de abril de 2026 em sistemas com políticas de validação de plataforma TPM, afetando configurações que incluem PCR7, o certificado Windows UEFI CA 2023 no banco de dados Secure Boot e gerenciadores de boot incompatíveis.
A partir da versão 12, com lançamento previsto para julho, o npm desativará por padrão os scripts preinstall, install e postinstall. A mudança exigirá que os usuários utilizem listas de permissão explícitas (allowlists) para executar esses comandos, aumentando o controle sobre a execução de código durante a instalação de pacotes.
Um pesquisador de segurança explorou APIs internas e públicas do Google utilizando uma estratégia automatizada de coleta de chaves, scraping de documentos de descoberta e um explorador de API personalizado integrado a um fuzzer orientado por IA. O sistema coletou milhares de chaves de API válidas de aplicativos, tráfego web e binários, mapeando o acesso a mais de 1.500 APIs com diferentes níveis de visibilidade e restrições. Ao realizar a reexecução e o agrupamento de sondas com múltiplas chaves, analisar padrões de erro padronizados do Google e aplicar suporte a autenticação robusta, o pesquisador identificou falhas reais de controle de acesso, incluindo endpoints internos que expunham dados sensíveis de contas, conteúdos e configurações, resultando em mais de US$ 500.000 em recompensas de programas de bug bounty.
O Chromium 150 remove a flag ExtensionManifestV2Disabled, enquanto a versão 151 elimina a ExtensionManifestV2Unsupported, AllowLegacyMV2Extensions e outras flags relacionadas. A alteração bloqueia permanentemente extensões baseadas em MV2, como o uBlock Origin, e inviabiliza todos os contornos via Registro do Windows.
