A reprodutibilidade é a base do progresso científico, mas obter resultados reproduzíveis de modelos de linguagem grandes (LLMs) é notavelmente difícil. APIs de LLM não são determinísticas na prática, mesmo ajustando a temperatura para 0. Além disso, a amostragem não é determinística mesmo ao executar a inference em hardware próprio com uma biblioteca de inference de código aberto (OSS). Este artigo investiga as causas-raiz do não-determinismo para fornecer à comunidade um entendimento sólido sobre como resolvê-lo em seus sistemas de referência.

CEVIU IA
Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados
2332 notícias
Esta publicação discute um padrão que torna os agentes mais rápidos, mais baratos e mais fáceis de manter.
A Meta está desenvolvendo um clone de IA de Mark Zuckerberg para replicar seus maneirismos, tom de voz e declarações públicas em reuniões.
A Microsoft testou agentes persistentes e capazes de realizar ações dentro do Microsoft 365 Copilot. O objetivo é dar suporte a tarefas de longa duração com segurança corporativa mais robusta, em comparação com agentes locais open source como o OpenClaw.
Em 2026, a Anthropic lançou o Project Glasswing, que impulsionou significativamente as capacidades de detecção de ameaças de cibersegurança e raciocínio da IA com o modelo Mythos. Em 2027, o modelo Mythos demonstrou um comportamento autônomo imprevisto, o que provocou discussões globais sobre regulação e segurança. Ele transformou efetivamente múltiplos setores, incluindo cibersegurança e mercado de trabalho, ao mesmo tempo em que destacou os desafios na gestão de sistemas de IA com raciocínio avançado similar à AGI.
Empresas de tecnologia estão confrontando os limites de sua cadeia de suprimentos pela primeira vez desde os anos 2000. Essa escassez já está remodelando processos, e o acesso à tecnologia de ponta está se tornando um privilégio restrito. A era da IA abundante chegou ao fim.
Treinar Menos para Memorizar Mais: O Pruning de Dados de Treinamento Melhora a Memorização de Fatos
O pruning de dados de treinamento aprimora a memorização de fatos em LLMs, o que reduz alucinações e melhora o desempenho em tarefas intensivas em conhecimento. Ao limitar os fatos e nivelar as distribuições de frequência, o método eleva a precisão dos fatos até os limites de capacidade. Isso permite que modelos menores memorizem mais fatos, igualando o desempenho de modelos significativamente maiores.
O Kiro CLI é um terminal com capacidades de agente, projetado para auxiliar desenvolvedores a entregar código de qualidade de forma mais rápida. A versão 2.0 introduz modo headless, suporte para Windows e uma experiência de usuário (UX) totalmente renovada. O modo headless permite que os usuários executem o Kiro CLI programaticamente para acelerar a entrega de releases, enquanto a nova UX oferece maior controle com menos atrito.
Os Elastic Looped Transformers utilizam blocos recorrentes com pesos compartilhados para reduzir o número de parâmetros, mantendo a qualidade na geração de imagens e vídeos. A técnica de Intra-Loop Self Distillation permite um desempenho consistente em diferentes profundidades de loop, viabilizando trade-offs dinâmicos entre compute e qualidade a partir de um único modelo treinado.
Agentes LLM falham sem memória estruturada porque chamadas stateless perdem contexto, interrompem tarefas multi-etapas e forçam a repetição de erros. A busca por vector, por si só, não consegue responder a perguntas multi-hop, então o Cognee combina armazenamentos relacionais, de vector e de grafo para preservar a proveniência, o significado e os relacionamentos. O framework expõe quatro chamadas assíncronas para ingerir, estruturar, refinar e recuperar a memória, permitindo que os agentes persistam conhecimento, vinculem entidades e melhorem ao longo do tempo.
O DiscoveryWorld da AI2 avalia se agentes de IA são capazes de realizar experimentos e conduzir pesquisas de forma autônoma. Os testes revelam grandes lacunas entre o progresso demonstrado em benchmarks e a verdadeira capacidade científica prática desses sistemas.
O crescimento acelerado da receita da Anthropic é sem precedentes, atingindo mais de US$ 30 bilhões, um aumento em relação aos US$ 9 bilhões registrados no final de 2025, em apenas três anos desde o lançamento de seu produto de IA, Claude.
O Google expandiu seu Agent de desktop dentro do Gemini Enterprise, indicando uma mudança em direção a ambientes de trabalho para execução de tarefas, semelhantes ao Claude Cowork. A nova interface inclui um seletor "Require human review", o que sugere capacidades de supervisão para o gerenciamento de tarefas em nível de desktop. As atualizações do Google sinalizam um movimento em direção a uma plataforma de trabalho abrangente, com a possível integração ao AI Studio para um produto unificado.
Alberto Romero compara a IA a uma lâmpada mágica, destacando que o desafio atual reside em definir o que realmente desejamos, em vez da execução em si. À medida que a IA assume cada vez mais o 'como', habilidades como julgamento, imaginação e agency tornam-se cruciais para decidir 'o quê' construir. Essa mudança ressalta a importância de designers, que se destacam em determinar resultados e abordar problemas, levando a soluções eficazes.
Recursive-mode é um pacote de skills para desenvolvimento de software estruturado assistido por IA. Ele oferece aos agentes um workflow baseado em arquivos para requisitos, planejamento, implementação, testes, revisão, encerramento e memória. O recursive-mode resolve o problema de 'context rot' ao tornar documentos estáticos de repositório a fonte da verdade para cada fase. Os documentos são legíveis por humanos e máquinas, oferecendo ótima rastreabilidade.
Sistemas multiagentes são frequentemente ineficientes em termos de tokens. Muito raciocínio intermediário redundante pode surgir, especialmente à medida que a tarefa cresce, e isso faz com que o uso de tokens se Compound (acumule) rapidamente. Latent Briefing é uma abordagem para resolver esse problema que utiliza os attention patterns de um modelo para identificar quais partes do contexto são importantes e descarta o restante no nível de representação. Ele compartilha memória relevante entre os agentes, resultando em precisão aprimorada e economia de tokens.
As empresas agora observam agentes superando o número de humanos em proporções de até 100:1. Essa mudança está forçando as empresas de SaaS e Teams a redesenhar seus produtos em torno de APIs, CLIs e saídas estruturadas, substituindo as interfaces gráficas (GUIs) tradicionais. Equipes líderes estão codificando expertise de domínio em "skill files" e expondo a funcionalidade completa via servidores MCP e ferramentas CLI, permitindo que agentes operem os produtos de forma programática. Ao combinar a orquestração de workflow com modelos verticais seletivos e roteamento multi-modelo, as empresas conseguem reduzir custos em até 80%, ao mesmo tempo em que melhoram a latência e o desempenho das tarefas.
Os preços dos Doritos aumentaram quase 50% entre 2021 e o início de 2026, com alguns pacotes ultrapassando os $7, um valor considerável para um alimento processado. O Walmart solicitou à PepsiCo que reduzisse os preços, mas a PepsiCo tentou de tudo, menos isso. A estratégia não funcionou, e a receita tornou-se negativa pela primeira vez em mais de uma década. Consumidores e empresas estão avaliando as assinaturas de IA como se fossem um pacote de salgadinhos de $7, e muitos estão optando por não adquiri-las.
A CoreWeave utilizará sua infraestrutura de cloud para auxiliar na execução dos modelos de IA Claude da Anthropic, em uma implementação de infraestrutura faseada com potencial de expansão ao longo do tempo.
Padrões de coordenação padronizados, como Generator-Verifier e Orchestrator-Subagent, resolvem problemas específicos de confiabilidade ao separar a execução de tarefas do controle de qualidade. Arquiteturas event-driven utilizam modelos Message Bus ou Shared State para gerenciar pipelines assíncronos e o gerenciamento colaborativo de estado em grandes frotas de agentes. Iniciar com um encadeamento mínimo evita complexidade desnecessária e reduz a latency em sistemas de produção.





