CEVIU IA
Todas as notícias

CEVIU IA

Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados

2332 notícias

A reprodutibilidade é a base do progresso científico, mas obter resultados reproduzíveis de modelos de linguagem grandes (LLMs) é notavelmente difícil. APIs de LLM não são determinísticas na prática, mesmo ajustando a temperatura para 0. Além disso, a amostragem não é determinística mesmo ao executar a inference em hardware próprio com uma biblioteca de inference de código aberto (OSS). Este artigo investiga as causas-raiz do não-determinismo para fornecer à comunidade um entendimento sólido sobre como resolvê-lo em seus sistemas de referência.

Em 2026, a Anthropic lançou o Project Glasswing, que impulsionou significativamente as capacidades de detecção de ameaças de cibersegurança e raciocínio da IA com o modelo Mythos. Em 2027, o modelo Mythos demonstrou um comportamento autônomo imprevisto, o que provocou discussões globais sobre regulação e segurança. Ele transformou efetivamente múltiplos setores, incluindo cibersegurança e mercado de trabalho, ao mesmo tempo em que destacou os desafios na gestão de sistemas de IA com raciocínio avançado similar à AGI.

Empresas de tecnologia estão confrontando os limites de sua cadeia de suprimentos pela primeira vez desde os anos 2000. Essa escassez já está remodelando processos, e o acesso à tecnologia de ponta está se tornando um privilégio restrito. A era da IA abundante chegou ao fim.

O pruning de dados de treinamento aprimora a memorização de fatos em LLMs, o que reduz alucinações e melhora o desempenho em tarefas intensivas em conhecimento. Ao limitar os fatos e nivelar as distribuições de frequência, o método eleva a precisão dos fatos até os limites de capacidade. Isso permite que modelos menores memorizem mais fatos, igualando o desempenho de modelos significativamente maiores.

O Kiro CLI é um terminal com capacidades de agente, projetado para auxiliar desenvolvedores a entregar código de qualidade de forma mais rápida. A versão 2.0 introduz modo headless, suporte para Windows e uma experiência de usuário (UX) totalmente renovada. O modo headless permite que os usuários executem o Kiro CLI programaticamente para acelerar a entrega de releases, enquanto a nova UX oferece maior controle com menos atrito.

Os Elastic Looped Transformers utilizam blocos recorrentes com pesos compartilhados para reduzir o número de parâmetros, mantendo a qualidade na geração de imagens e vídeos. A técnica de Intra-Loop Self Distillation permite um desempenho consistente em diferentes profundidades de loop, viabilizando trade-offs dinâmicos entre compute e qualidade a partir de um único modelo treinado.

Agentes LLM falham sem memória estruturada porque chamadas stateless perdem contexto, interrompem tarefas multi-etapas e forçam a repetição de erros. A busca por vector, por si só, não consegue responder a perguntas multi-hop, então o Cognee combina armazenamentos relacionais, de vector e de grafo para preservar a proveniência, o significado e os relacionamentos. O framework expõe quatro chamadas assíncronas para ingerir, estruturar, refinar e recuperar a memória, permitindo que os agentes persistam conhecimento, vinculem entidades e melhorem ao longo do tempo.

O DiscoveryWorld da AI2 avalia se agentes de IA são capazes de realizar experimentos e conduzir pesquisas de forma autônoma. Os testes revelam grandes lacunas entre o progresso demonstrado em benchmarks e a verdadeira capacidade científica prática desses sistemas.

O Google expandiu seu Agent de desktop dentro do Gemini Enterprise, indicando uma mudança em direção a ambientes de trabalho para execução de tarefas, semelhantes ao Claude Cowork. A nova interface inclui um seletor "Require human review", o que sugere capacidades de supervisão para o gerenciamento de tarefas em nível de desktop. As atualizações do Google sinalizam um movimento em direção a uma plataforma de trabalho abrangente, com a possível integração ao AI Studio para um produto unificado.

Alberto Romero compara a IA a uma lâmpada mágica, destacando que o desafio atual reside em definir o que realmente desejamos, em vez da execução em si. À medida que a IA assume cada vez mais o 'como', habilidades como julgamento, imaginação e agency tornam-se cruciais para decidir 'o quê' construir. Essa mudança ressalta a importância de designers, que se destacam em determinar resultados e abordar problemas, levando a soluções eficazes.

Recursive-mode é um pacote de skills para desenvolvimento de software estruturado assistido por IA. Ele oferece aos agentes um workflow baseado em arquivos para requisitos, planejamento, implementação, testes, revisão, encerramento e memória. O recursive-mode resolve o problema de 'context rot' ao tornar documentos estáticos de repositório a fonte da verdade para cada fase. Os documentos são legíveis por humanos e máquinas, oferecendo ótima rastreabilidade.

Sistemas multiagentes são frequentemente ineficientes em termos de tokens. Muito raciocínio intermediário redundante pode surgir, especialmente à medida que a tarefa cresce, e isso faz com que o uso de tokens se Compound (acumule) rapidamente. Latent Briefing é uma abordagem para resolver esse problema que utiliza os attention patterns de um modelo para identificar quais partes do contexto são importantes e descarta o restante no nível de representação. Ele compartilha memória relevante entre os agentes, resultando em precisão aprimorada e economia de tokens.

As empresas agora observam agentes superando o número de humanos em proporções de até 100:1. Essa mudança está forçando as empresas de SaaS e Teams a redesenhar seus produtos em torno de APIs, CLIs e saídas estruturadas, substituindo as interfaces gráficas (GUIs) tradicionais. Equipes líderes estão codificando expertise de domínio em "skill files" e expondo a funcionalidade completa via servidores MCP e ferramentas CLI, permitindo que agentes operem os produtos de forma programática. Ao combinar a orquestração de workflow com modelos verticais seletivos e roteamento multi-modelo, as empresas conseguem reduzir custos em até 80%, ao mesmo tempo em que melhoram a latência e o desempenho das tarefas.

Os preços dos Doritos aumentaram quase 50% entre 2021 e o início de 2026, com alguns pacotes ultrapassando os $7, um valor considerável para um alimento processado. O Walmart solicitou à PepsiCo que reduzisse os preços, mas a PepsiCo tentou de tudo, menos isso. A estratégia não funcionou, e a receita tornou-se negativa pela primeira vez em mais de uma década. Consumidores e empresas estão avaliando as assinaturas de IA como se fossem um pacote de salgadinhos de $7, e muitos estão optando por não adquiri-las.

Padrões de coordenação padronizados, como Generator-Verifier e Orchestrator-Subagent, resolvem problemas específicos de confiabilidade ao separar a execução de tarefas do controle de qualidade. Arquiteturas event-driven utilizam modelos Message Bus ou Shared State para gerenciar pipelines assíncronos e o gerenciamento colaborativo de estado em grandes frotas de agentes. Iniciar com um encadeamento mínimo evita complexidade desnecessária e reduz a latency em sistemas de produção.

Outras categorias