CEVIU IA
Todas as notícias

CEVIU IA

Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados

2317 notícias

Asuka Zheng argumenta que o pânico de "estamos ficando sem dados de treinamento" ignora a real dinâmica do mercado de dados, citando seu próprio projeto de substituição de SRE que treinou dois modelos de mundo até estagnar porque trajetórias de incidentes de longo horizonte, de ponta a ponta, desde a primeira anomalia até a resolução completa, não existiam como um dataset.

A MiniMax divulgou um novo relatório técnico aprofundado sobre o desenvolvimento de sua popular série de modelos de linguagem M2, detalhando inovações de engenharia e abordagens inteligentes. O relatório também apresenta uma nova abordagem de sparse attention que será utilizada na próxima série de modelos da MiniMax, prometendo um aumento de até 15.6 vezes na velocidade de decodificação em contextos longos. Com os futuros modelos M3 da MiniMax, o deployment de agentes de IA com contexto ultra-longo se tornará economicamente viável.

A Microsoft está desenvolvendo um novo modelo de IA para fortalecer sua posição na área de codificação via IA. Este esforço destaca a contínua competição da Microsoft no desenvolvimento de IA e sua resposta às demandas crescentes da indústria. A iniciativa visa aprimorar as capacidades de codificação e apoiar avanços na tecnologia de IA.

A SpaceX assinou um importante acordo de compute com a Anthropic este mês, avaliado em bilhões de dólares mensais. No entanto, Elon Musk minimizou recentemente o acordo, afirmando que a SpaceX não se comprometeu a alugar seu compute por anos, embora isso possa acontecer. Na verdade, o contrato é de 180 dias com uma cláusula de cancelamento mútuo de 90 dias após esse período. O prazo curto foi um pedido da SpaceX, que pode querer reaver o compute em algum momento. A declaração de Musk contradiz diretamente o registro S-1 da SpaceX, que apresenta o acordo como um contrato de três anos.

O Agent Judge aprimora as avaliações para agentes de IA em produção com contexto estendido, focando em busca, verificação e adaptação. Ele aborda as deficiências dos avaliadores baseados em LLMs, gerenciando trajetórias complexas, verificando ações estatais contra sistemas e atualizando métricas com base em feedback real. Testes mostram que o Agent Judge, especialmente com métricas refinadas, supera avaliadores LLM tradicionais em precisão e consistência, particularmente em cenários desafiadores.

Jarred Sumner utilizou os workflows dinâmicos do Claude para reescrever o Bun de Zig para Rust, alcançando 99,8% de sucesso nos testes com 750.000 linhas de Rust em apenas 11 dias. Os workflows dinâmicos permitem que o Claude divida tarefas complexas em subtarefas, com agentes executando-as em paralelo até que os resultados convirjam para uma solução eficiente e precisa.

O artigo apresenta um método para reduzir o payload de sincronização de pesos em RL assíncrona utilizando a "Delta Weight Sync". Essa técnica transmite apenas os parâmetros do modelo que foram alterados entre os passos de RL, o que reduz significativamente a transferência de dados de gigabytes para megabytes. Um "bucket" do Hugging Face Hub gerencia o armazenamento de objetos de alta frequência, permitindo localizações separadas para o treinador e o motor de inference sem comunicação direta, resultando em economias substanciais de largura de banda.

Apex é um modelo de codificação para React Native, treinado para construir aplicativos analisando decisões de arquitetura, corrigindo problemas específicos do framework e raciocinando sobre as restrições. Embora não iguale os frontier models em benchmarks de codificação, este modelo otimizado altera significativamente a relação desempenho-custo dentro de seu domínio específico. O modelo ainda está em desenvolvimento e agora está disponível em beta privado para equipes selecionadas.

O LiteParse é uma ferramenta standalone de código aberto (OSS) para parseamento de PDFs que oferece análise espacial de texto de alta qualidade com bounding boxes, sem depender de recursos proprietários de LLM ou de serviços na nuvem. A ferramenta se destaca pelo parseamento rápido de texto, geração de screenshots e suporte a múltiplos idiomas, plataformas e formatos de saída. Todo o processamento ocorre localmente nas máquinas dos usuários.

Anthropic e OpenAI iniciaram uma precificação agressiva de suas APIs, indicando que provavelmente encontraram product-market fit com produtos de codificação e agentes de uso geral. Gastos superiores a US$ 200 por mês por usuário ajudam essas empresas a cobrir custos de forma mais eficaz do que cobranças de US$ 10 a US$ 20 por mês. Agentes de codificação amplificam significativamente esse nível de investimento.

Sistemas no mundo real frequentemente se comportam de forma diferente em produção do que no laboratório. As equipes muitas vezes descobrem essas falhas após o lançamento, gastando semanas para corrigi-las. Esse ciclo de feedback é lento e manual. Atualmente, é possível construir agentes que se auto-aprimoram. Esta publicação explora como a OpenAI usou o Codex para construir esse tipo de agente na Thrive Holdings, resultando em uma IA capaz de preparar declarações de imposto cada vez mais complexas.

O Biohub disponibilizou para a comunidade de pesquisa seu open discovery engine para previsão, design e descoberta biológica de estruturas de proteínas. O lançamento inclui o ESMC, um modelo de linguagem avançado que internalizou as propriedades fundamentais da biologia de proteínas; o ESMFold2, um motor de design que transforma as representações de sequência do ESMC em estruturas 3D de complexos biomoleculares com resolução atômica; e o ESM Atlas, que permite a navegação das representações do ESMC em 6,8 bilhões de sequências de proteínas e 1,1 bilhão de estruturas previstas. Todos os três modelos estão disponíveis gratuitamente para a comunidade científica global.

Outras categorias