Modelos quantizados são realmente eficazes. A quantização de 16 bits para 8 bits quase não afeta a qualidade, já a quantização de 4 bits é mais perceptível, mas ainda atende cerca de 90% do desempenho do original. Vale a pena experimentar esses modelos, pois são menores e compatíveis com mais sistemas. Este artigo explica como funcionam os parâmetros dos modelos, o que é quantização, como é aplicada na prática e seus efeitos na precisão dos modelos.

CEVIU IA
Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados
2332 notícias
A OpenAI delineou a filosofia e estrutura por trás de sua Model Spec, uma estrutura que define o comportamento desejado do modelo, princípios de segurança e como os sistemas devem seguir instruções e resolver conflitos.
O treino final de um modelo é apenas a etapa final de um processo longo e caro. Antes dessa etapa, empresas queimam compute realizando experimentos em várias escalas, gerando dados sintéticos, testando ideias e treinando modelos não lançados. O custo completo do desenvolvimento de um modelo é muito mais alto que o custo do treino final de um modelo de fronteira. A maior parte do gasto está na exploração, não na execução. Empresas que aprendem com a concorrência podem replicar resultados por uma fração do custo original.
Manthan Gupta desenvolveu o Auto-Inference-Optimiser para permitir que um agente de IA otimize a velocidade de inferência de LLM enquanto mantém a qualidade fixa no Apple Silicon. O uso de amostragem argmax e simplificação do código de inferência proporcionou os maiores ganhos de throughput, enquanto a maioria das opções de ajuste e quantização do cache KV não tiveram efeito ou até mesmo foram prejudiciais. O projeto destaca que um controle rigoroso e observável é crucial para distinguir ganhos reais de performance de ruídos ou ilusões de benchmark.
Empresas de IA estão mudando de soluções específicas para plataformas amplas, impulsionadas por rápidas mudanças nos modelos.
O Lyria 3 Pro estende a duração máxima das faixas para três minutos e oferece controle mais preciso sobre a estrutura e personalização das músicas.
Devin, da Cognition, é um engenheiro de software IA capaz de criar software do início ao fim sem intervenção humana. Desde seu lançamento em 2024, é visto como um passo rumo ao sonho de uma máquina que codifica por você, alimentado por um desejo antigo do Vale do Silício. O CEO da Cognition, Scott Wu, acredita que essa tecnologia não marcará o fim da engenharia de software. Em vez de eliminar engenheiros, as ferramentas da Cognition permitirão que eles se concentrem nas partes mais gratificantes do trabalho, poupando-os das tarefas pesadas que consomem a maior parte do tempo tradicionalmente.
Harvey levantou $200 milhões em uma nova rodada liderada por GIC e Sequoia, elevando sua avaliação para $11 bilhões e o financiamento total para mais de $1 bilhão.
A Reflection é uma startup que lidera um esforço para criar sistemas de IA dos EUA de acesso livre. É uma das poucas startups ligadas à Nvidia que busca construir uma rede de modelos de IA open source. A empresa está em negociações para levantar US$ 2,5 bilhões com uma valorização de US$ 25 bilhões. Investidores chamam a Reflection de 'DeepSeek do Ocidente', oferecendo uma alternativa aos modelos open source de empresas chinesas.
ARC-AGI-3 foi projetado para avaliar a inteligência agentic por meio de ambientes de raciocínio interativos. Superar esse modelo significaria que um sistema de IA alcança ou excede a eficiência humana em todos os ambientes ao vê-los pela primeira vez. 100% dos ambientes são solucionáveis por humanos no primeiro contato, sem treinamento prévio ou instrução. Atualmente, todos os modelos de raciocínio de IA de fronteira resolvem menos de 1%.
A OpenAI lançou um programa público de bug bounty focado no uso indevido de IA e riscos à segurança, expandindo o foco além das vulnerabilidades tradicionais de segurança para incluir cenários de abuso.
Os co-fundadores da Manus, Xiao Hong e Ji Yichao, foram informados de que não podem deixar a China enquanto as autoridades revisam a venda de US$ 2,5 bilhões da empresa para a Meta. As primeiras versões da Manus foram criadas por engenheiros de uma empresa chinesa. Uma entidade com sede em Cingapura assumiu as operações posteriormente e transferiu a maioria dos funcionários baseados na China para Cingapura, o que possibilitou a compra pela Meta. As autoridades temem que as ações da Manus possam encorajar outras empresas chinesas a fazer o mesmo e sair do país sem passar por avaliações.
Modelos open source estão alcançando a paridade com os modelos de fronteira, fazendo com que o valor dos laboratórios de fronteira pareça superestimado se forem apenas utilitários. Esses laboratórios possuem acordos empresariais, certificações de segurança, distribuição, talento em pesquisa e posicionamento regulatório, mas isso não explica seu moat. As pessoas se concentram na capacidade, mas o que realmente importa para as avaliações é a diferença monetizável, o subconjunto dessa diferença de capacidade pelo qual alguém pagaria um prêmio. A diferença monetizável está diminuindo mais rápido do que a diferença de capacidade.
TurboQuant da Google é um algoritmo de compressão que reduz o impacto de memória de grandes modelos de linguagem enquanto aumenta a velocidade e mantém a precisão. Ele diminui o tamanho do cache de chave-valor, evitando a necessidade de recomputação. Testes iniciais mostram um aumento de desempenho de 8x e uma redução de uso de memória de 6x, sem perda de qualidade. Técnicas de compressão como a TurboQuant podem melhorar a qualidade das saídas de modelos para dispositivos edge sem enviar dados para a nuvem.
Este post detalha um problema que levaria um especialista humano de um a três meses para resolver. O problema foi eventualmente solucionado por duas pessoas usando o GPT-5.4 Pro. Um link para a transcrição completa da conversa com o GPT-5.4 Pro está disponível. Outros modelos que solucionaram o problema incluem o GPT 5.4 (xhigh), Gemini 3.1 Pro e Claude Opus 4.6 (max).
Um pequeno clipe mostra um iPhone 17 Pro rodando o Qwen3.5-397B-A17B, um modelo Mixture-of-Experts com 397 bilhões de parâmetros, a 0,6 tokens por segundo.
Isso sugere que o comércio baseado em agentes ainda não está pronto para substituir as compras tradicionais.
A OpenAI identificou que sua estreita relação com a Microsoft representa um risco potencial para seus negócios, já que a Microsoft é responsável por uma parte substancial do financiamento e do compute da OpenAI. Outros riscos incluem grandes despesas de capital, dependência de recursos computacionais, litígios em andamento com a xAI e sua estrutura incomum como uma corporação de benefício público. Os resultados operacionais da OpenAI dependerão de sua habilidade em desenvolver relações com outros parceiros. Apesar da parceria forte, OpenAI e Microsoft estão competindo cada vez mais no mercado de IA generativa. ️
A OpenAI contratou Dave Dugan, ex-executivo de publicidade da Meta, como vice-presidente de soluções globais de anúncios. A empresa busca urgentemente novas fontes de receita para sustentar suas grandes necessidades de financiamento. Dugan é conhecido por seus relacionamentos próximos com as principais empresas de publicidade do mundo, o que pode influenciar onde as marcas alocam seus orçamentos de publicidade.
As empresas de software têm dois caminhos claros: acelerar o crescimento com produtos de IA ou alcançar margens operacionais verdadeiras acima de 40%.





