CEVIU IA
Todas as notícias

CEVIU IA

Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados

2332 notícias

O NEMOTRON OCR V2, desenvolvido com dados sintéticos, é um modelo OCR multilíngue rápido e preciso que alcança melhorias significativas na acurácia, reduzindo as pontuações NED para quase zero em idiomas não-ingleses. Utilizando um pipeline de dados sintéticos com texto mOSCAR e diversas fontes, o modelo é treinado com anotações pixel-perfect em diferentes idiomas, permitindo a generalização para documentos do mundo real. Sua arquitetura unificada reutiliza feature maps, atingindo velocidades de 34,7 páginas por segundo em uma única GPU A100 e superando modelos especializados em tarefas de OCR para idiomas diversos.

O Google está em negociações com a Marvell Technology para desenvolver uma unidade de processamento de memória e um TPU otimizado para inference. Essa movimentação ocorre enquanto o mercado de ASICs customizados projeta um crescimento de 45% em 2026, com expectativa de alcançar US$ 118 bilhões até 2033. A Broadcom, que é a principal parceira do Google para chips customizados, anunciou recentemente um acordo de longo prazo para projetar e fornecer TPUs e componentes de rede até 2031. As conversas com a Marvell, no entanto, ainda não resultaram em um contrato assinado.

Modelos de IA aprimorados, como Opus 4.5 e GPT-5.2, resultaram em um aumento de 44% no uso de IA por desenvolvedores, permitindo a execução de tarefas mais complexas após um período inicial de adaptação. Este crescimento notável foi observado em diversos setores, incluindo mídia e publicidade, impulsionado tanto por pressões competitivas quanto pela emergência de novas oportunidades. A mudança no perfil de trabalho dos desenvolvedores se tornou evidente, com um foco crescente na gestão da saída da IA. Houve um aumento significativo em atividades relacionadas à documentação, arquitetura de sistemas e tarefas de aprendizado.

A Canon estrutura seu pipeline de busca utilizando um DAG (Directed Acyclic Graph) para assegurar concorrência automática em processos como classificação, localização, retrieval e ranking. Essa configuração proporciona controle independente sobre os nós, facilitando a modificação de subsistemas específicos sem impactar a funcionalidade geral do pipeline. O framework DAG otimiza a execução por meio de paralelismo, garante execução durável com retries específicos para cada nó e oferece introspecção clara, além de um desacoplamento eficaz da execução.

A duração das tarefas que os agentes de IA conseguem realizar tem crescido exponencialmente nos últimos sete anos. Os modelos mais recentes podem (às vezes) executar tarefas que levariam algumas horas para um ser humano. Contudo, o custo para atingir esses horizontes de tempo está aumentando exponencialmente, e os custos horários de alguns modelos já se aproximam dos custos humanos. Haverá, em algum momento, uma divergência entre o que é possível em termos de tempo e o que é economicamente viável.

Dois dos arquitetos por trás das mais ambiciosas iniciativas da OpenAI, Kevin Weil e Bill Peebles, estão deixando a empresa. Weil liderou a iniciativa de pesquisa científica da companhia, enquanto Peebles foi o pesquisador responsável pelo Sora. Ambos anunciaram suas saídas na sexta-feira. A OpenAI decidiu recentemente cortar 'projetos secundários', consolidando seus esforços na IA empresarial e em seu futuro superapp.

A Cursor, uma startup de codificação com IA, está próxima de captar US$2 bilhões em financiamento, com potencial para dobrar sua avaliação para US$50 bilhões. Espera-se que a Thrive e a Andreessen Horowitz liderem esta rodada, com a possível participação da Battery Ventures e da Nvidia. A Cursor almeja triplicar sua receita anualizada para mais de US$6 bilhões até o final de 2026, impulsionada por seu modelo proprietário Composer e por mudanças estratégicas que visam alcançar a lucratividade.

Claude Design é uma ferramenta para criar trabalhos visuais utilizando o modelo de visão Claude Opus 4.7. Ela permite que os usuários desenvolvam protótipos, pitch decks e materiais de marketing, automatizando a consistência da marca e facilitando a colaboração. A ferramenta se integra ao Claude Code para uma transição fluida do protótipo para a produção.

Prefill-as-a-Service (PrfaaS) é uma arquitetura de serving cross-datacenter que descarrega seletivamente o prefill de contexto longo para clusters de prefill autônomos e densos em compute. Em seguida, transfere o KVCache resultante via Ethernet comercial para clusters locais de PD para decodificação. Esta abordagem combina a eficiência KV do lado do modelo com um offloading seletivo do lado do sistema, agendamento sensível à largura de banda e alocação de requisições sensível ao cache. O design do PrfaaS elimina a exigência de que aceleradores heterogêneos compartilhem o mesmo fabric RDMA de baixa latência, permitindo o escalonamento independente da capacidade de prefill e decodificação entre clusters fracamente acoplados. Uma implantação heterogênea aumentada por PrfaaS alcança maior throughput de serving, consumindo apenas uma largura de banda cross-datacenter modesta.

Jensen Huang participou recentemente de uma entrevista onde abordou tópicos em sua maioria já conhecidos. Contudo, houve três momentos em que Huang revelou mais do que provavelmente pretendia. Jensen chegou a perder a compostura ao discutir a China e se as vendas de chips deveriam ser restritas na região. Esta publicação detalha cada uma dessas interações e aponta outras observações feitas durante a entrevista.

Um novo Skill e Test Harness foram desenvolvidos para auxiliar na portabilidade de modelos transformer para mlx-lm, otimizando o processo de contribuições e revisões. Esta ferramenta suporta contribuidores ao gerenciar as tarefas de conversão de modelos e oferece aos revisores Pull Requests (PRs) assistidos por agente, completos com relatórios abrangentes. O objetivo é manter a qualidade do código e aumentar a eficiência em um ambiente open-source onde a revisão manual não consegue escalar.

Ternary Bonsai é uma família de modelos de linguagem de 1,58 bits que oferece desempenho aprimorado com uso mínimo de memória. Ele supera modelos de 1 bit, alcançando uma pontuação média de 75,5 em benchmarks e proporcionando uma eficiência energética de 3 a 4 vezes melhor. Disponíveis nas versões de 8B, 4B e 1,7B, esses modelos permitem um deployment flexível em dispositivos como Macs e iPhones, sob a licença Apache 2.0.

Este guia descreve uma abordagem estruturada para a modernização de grandes codebases, utilizando agentes em sandbox que operam em tarefas isoladas, validam as alterações e retornam patches auditáveis, com a orquestração permanecendo fora do ambiente de execução.

Outras categorias