O NEMOTRON OCR V2, desenvolvido com dados sintéticos, é um modelo OCR multilíngue rápido e preciso que alcança melhorias significativas na acurácia, reduzindo as pontuações NED para quase zero em idiomas não-ingleses. Utilizando um pipeline de dados sintéticos com texto mOSCAR e diversas fontes, o modelo é treinado com anotações pixel-perfect em diferentes idiomas, permitindo a generalização para documentos do mundo real. Sua arquitetura unificada reutiliza feature maps, atingindo velocidades de 34,7 páginas por segundo em uma única GPU A100 e superando modelos especializados em tarefas de OCR para idiomas diversos.

CEVIU IA
Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados
2332 notícias
O Google está em negociações com a Marvell Technology para desenvolver uma unidade de processamento de memória e um TPU otimizado para inference. Essa movimentação ocorre enquanto o mercado de ASICs customizados projeta um crescimento de 45% em 2026, com expectativa de alcançar US$ 118 bilhões até 2033. A Broadcom, que é a principal parceira do Google para chips customizados, anunciou recentemente um acordo de longo prazo para projetar e fornecer TPUs e componentes de rede até 2031. As conversas com a Marvell, no entanto, ainda não resultaram em um contrato assinado.
Modelos de IA aprimorados, como Opus 4.5 e GPT-5.2, resultaram em um aumento de 44% no uso de IA por desenvolvedores, permitindo a execução de tarefas mais complexas após um período inicial de adaptação. Este crescimento notável foi observado em diversos setores, incluindo mídia e publicidade, impulsionado tanto por pressões competitivas quanto pela emergência de novas oportunidades. A mudança no perfil de trabalho dos desenvolvedores se tornou evidente, com um foco crescente na gestão da saída da IA. Houve um aumento significativo em atividades relacionadas à documentação, arquitetura de sistemas e tarefas de aprendizado.
A Canon estrutura seu pipeline de busca utilizando um DAG (Directed Acyclic Graph) para assegurar concorrência automática em processos como classificação, localização, retrieval e ranking. Essa configuração proporciona controle independente sobre os nós, facilitando a modificação de subsistemas específicos sem impactar a funcionalidade geral do pipeline. O framework DAG otimiza a execução por meio de paralelismo, garante execução durável com retries específicos para cada nó e oferece introspecção clara, além de um desacoplamento eficaz da execução.
A duração das tarefas que os agentes de IA conseguem realizar tem crescido exponencialmente nos últimos sete anos. Os modelos mais recentes podem (às vezes) executar tarefas que levariam algumas horas para um ser humano. Contudo, o custo para atingir esses horizontes de tempo está aumentando exponencialmente, e os custos horários de alguns modelos já se aproximam dos custos humanos. Haverá, em algum momento, uma divergência entre o que é possível em termos de tempo e o que é economicamente viável.
A versão Canva IA 2.0 está disponível a partir de hoje como uma prévia de pesquisa para o primeiro milhão de usuários que acessarem o site do Canva.
Dois dos arquitetos por trás das mais ambiciosas iniciativas da OpenAI, Kevin Weil e Bill Peebles, estão deixando a empresa. Weil liderou a iniciativa de pesquisa científica da companhia, enquanto Peebles foi o pesquisador responsável pelo Sora. Ambos anunciaram suas saídas na sexta-feira. A OpenAI decidiu recentemente cortar 'projetos secundários', consolidando seus esforços na IA empresarial e em seu futuro superapp.
A Cursor, uma startup de codificação com IA, está próxima de captar US$2 bilhões em financiamento, com potencial para dobrar sua avaliação para US$50 bilhões. Espera-se que a Thrive e a Andreessen Horowitz liderem esta rodada, com a possível participação da Battery Ventures e da Nvidia. A Cursor almeja triplicar sua receita anualizada para mais de US$6 bilhões até o final de 2026, impulsionada por seu modelo proprietário Composer e por mudanças estratégicas que visam alcançar a lucratividade.
Claude Design é uma ferramenta para criar trabalhos visuais utilizando o modelo de visão Claude Opus 4.7. Ela permite que os usuários desenvolvam protótipos, pitch decks e materiais de marketing, automatizando a consistência da marca e facilitando a colaboração. A ferramenta se integra ao Claude Code para uma transição fluida do protótipo para a produção.
O Google está testando uma ponte entre as assinaturas Gemini e o AI Studio, com o objetivo de oferecer aos usuários acesso a tokens baseado em assinatura, em vez de uma cobrança separada por API-key.
Prefill-as-a-Service (PrfaaS) é uma arquitetura de serving cross-datacenter que descarrega seletivamente o prefill de contexto longo para clusters de prefill autônomos e densos em compute. Em seguida, transfere o KVCache resultante via Ethernet comercial para clusters locais de PD para decodificação. Esta abordagem combina a eficiência KV do lado do modelo com um offloading seletivo do lado do sistema, agendamento sensível à largura de banda e alocação de requisições sensível ao cache. O design do PrfaaS elimina a exigência de que aceleradores heterogêneos compartilhem o mesmo fabric RDMA de baixa latência, permitindo o escalonamento independente da capacidade de prefill e decodificação entre clusters fracamente acoplados. Uma implantação heterogênea aumentada por PrfaaS alcança maior throughput de serving, consumindo apenas uma largura de banda cross-datacenter modesta.
A OpenAI atualizou o Codex com controle de computador em segundo plano, fluxos de trabalho multiagente e uma integração mais profunda com ferramentas de desenvolvimento, expandindo seu papel em todo o ciclo de vida de desenvolvimento de software.
A OpenAI apresentou o GPT-Rosalind, um modelo especializado projetado para apoiar a descoberta de medicamentos e a pesquisa biológica através de raciocínio aprimorado, uso de ferramentas e integração com fontes de dados científicos.
A Anthropic lançou o Claude Opus 4.7, que oferece desempenho aprimorado em tarefas de engenharia complexas, capacidades de visão mais robustas e execução mais confiável para tarefas de longa duração em comparação com seu predecessor.
Jensen Huang participou recentemente de uma entrevista onde abordou tópicos em sua maioria já conhecidos. Contudo, houve três momentos em que Huang revelou mais do que provavelmente pretendia. Jensen chegou a perder a compostura ao discutir a China e se as vendas de chips deveriam ser restritas na região. Esta publicação detalha cada uma dessas interações e aponta outras observações feitas durante a entrevista.
Este post contém notas preliminares sobre paralelismos em pretraining, se a distillation pode ser interrompida, Mythos e o equilíbrio da cibersegurança, Pipeline RL e por que as execuções de pretraining falham.
Um novo Skill e Test Harness foram desenvolvidos para auxiliar na portabilidade de modelos transformer para mlx-lm, otimizando o processo de contribuições e revisões. Esta ferramenta suporta contribuidores ao gerenciar as tarefas de conversão de modelos e oferece aos revisores Pull Requests (PRs) assistidos por agente, completos com relatórios abrangentes. O objetivo é manter a qualidade do código e aumentar a eficiência em um ambiente open-source onde a revisão manual não consegue escalar.
Ternary Bonsai é uma família de modelos de linguagem de 1,58 bits que oferece desempenho aprimorado com uso mínimo de memória. Ele supera modelos de 1 bit, alcançando uma pontuação média de 75,5 em benchmarks e proporcionando uma eficiência energética de 3 a 4 vezes melhor. Disponíveis nas versões de 8B, 4B e 1,7B, esses modelos permitem um deployment flexível em dispositivos como Macs e iPhones, sob a licença Apache 2.0.
Este guia descreve uma abordagem estruturada para a modernização de grandes codebases, utilizando agentes em sandbox que operam em tarefas isoladas, validam as alterações e retornam patches auditáveis, com a orquestração permanecendo fora do ambiente de execução.
O chief product officer da Anthropic deixou o conselho da Figma após relatos de que os próximos modelos da Anthropic podem incluir ferramentas de design que competem com o produto principal da Figma.





