O olmo-eval é um novo workbench de avaliação projetado para o desenvolvimento iterativo de LLM. Aprimorando o padrão OLMES, ele simplifica a adição de benchmarks, oferece suporte a avaliações agentic e de múltiplos turnos, e facilita a análise ao comparar mudanças entre checkpoints de modelos. Diferente do Harbor, o olmo-eval foca na flexibilidade e na redução do uso de recursos computacionais, priorizando o fluxo de desenvolvimento em vez de benchmarks públicos.
Esta thread analisa a teoria de que o foco da DeepSeek em modelos open-source, compartilhamento de pesquisas e desenvolvimento de infraestrutura faz parte de uma estratégia mais ampla. O objetivo seria se tornar uma infraestrutura de IA fundamental, em vez de competir diretamente no mercado de produtos de consumo.
A Anthropic informou que desativou o Fable 5 e o Mythos 5 para todos os usuários após receber uma diretriz de controle de exportação do governo dos Estados Unidos, vinculada a preocupações de segurança nacional e riscos reportados de jailbreak.
O sistema de engenharia do Devin garante uma produtividade superior ao custo operacional, com o compromisso de US$ 10 milhões por cliente. A eficácia da plataforma é validada por meio de dados independentes, reforçando a confiança na produtividade de engenharia entregue pelo sistema.
OpenAI e Anthropic adotam estratégias distintas para a gestão de contexto em modelos de linguagem. A OpenAI utiliza técnicas de compactação, comprimindo os dados para manter apenas as informações relevantes em uma única thread longa, o que preserva a coerência. Por outro lado, a Anthropic segmenta as janelas de contexto entre vários agentes, onde cada um processa subproblemas independentes. Nesse modelo, os subagentes executam tarefas complexas e devolvem apenas o necessário para o agente principal, embora essa abordagem possa gerar redundância, perda de informações e um consumo maior de tokens.
A Ramp disponibilizou seu próprio benchmark privado, construído a partir de desafios reais de engenharia enfrentados internamente. O objetivo é fornecer à equipe uma forma precisa de avaliar modelos de codificação dentro do seu ecossistema real de software financeiro.
Rafa Schwinger faz engenharia reversa do Claude Mythos e do Fable, argumentando que a verdadeira vantagem competitiva não reside na arquitetura, mas no ambiente de desenvolvimento, o foundry. A capacidade é decomposta como a base de fundação multiplicada pelo sinal graduável extraído, tornando a recompensa verificável o insumo escasso e decisivo, uma vez que o texto e o compute bruto deixaram de ser. A receita combina pretraining denso, RL com verificador estilo GRPO, onde a solidez contra o reward-hacking é a restrição real, e recompensas de processo de longo horizonte com context-folding aprendido que supera janelas de um milhão de tokens operando a 32K ativos, além do test-time compute de best-of-N exposto como um controle de esforço.

ATUALIZAÇÃO (16/06/2026): não é mais rumor, foi lançado. 22/04/2026 O Google anunciou oficialmente o "Agent Marketplace integrado à Agent Gallery" para o Gemini Enterprise durante o Google Cloud Next '26. Este marketplace permite que as organizações encontrem e implementem agentes especializados de terceiros de parceiros como Accenture, Oracle e ServiceNow. Embora o conceito de um "Skills Marketplace" mais amplo para o Gemini Business esteja em desenvolvimento e novas funcionalidades estejam sendo lançadas (como a conexão com o Google Business Profile em junho de 2026), o anúncio do Agent Marketplace no Cloud Next '26 marca um lançamento oficial de uma plataforma de marketplace para habilidades de IA no contexto do Gemini Enterprise. (Rumor original) O Google está integrando seus produtos sob o Gemini Enterprise com uma nova aba de Skills Marketplace para habilidades pré-definidas e otimizadas pelo Google. O marketplace, voltado para ajudar equipes a desenvolverem dashboards e ferramentas de relatórios sem atrasos de engenharia, inclui uma UI de gerenciamento de habilidades, um construtor de habilidades e o próprio marketplace.
Redes de modelos de IA menores estão superando todos os sistemas de IA de fronteira atuais em termos de velocidade, precisão e custo. Assim como a visão sobre os mainframes na década de 1960 estava equivocada, o pensamento atual sobre a IA centralizada também está. O futuro aponta para uma rede de redes neurais.
Satya Nadella, CEO da Microsoft, defende que toda empresa precisa construir tanto capital humano quanto capital de token para sustentar sua evolução tecnológica.
A contagem de objetos permanece fragmentada entre datasets e tarefas específicas de cada domínio. Os modelos atuais de contagem são frequentemente adaptados a cenários restritos, apresentando dificuldades para generalizar entre categorias, domínios visuais, escalas de objetos e distribuições de densidade. Este artigo apresenta um modelo generalista para contagem de objetos guiada por texto que alcança alta precisão e capacidade de generalização em múltiplos domínios.
A Early Warning Services planeja expandir o Zelle internacionalmente, iniciando pelas remessas entre os Estados Unidos e a Índia até o final de 2026. A empresa também revelou a ZelleUSD, uma stablecoin lastreada em dólar destinada a suportar futuras capacidades de pagamentos transfronteiriços em outros mercados, estendendo o alcance do Zelle além de sua rede de pagamentos de 1,2 trilhão de dólares nos Estados Unidos.
O equivalente da era da IA aos sistemas de registro do SaaS são as clearinghouses para agentes: a camada que governa o que agentes sabem, veem, fazem e comprovam após a execução. As vantagens competitivas mudarão da propriedade de dados para o controle de permissões, políticas, execução e trilhas de auditoria, criando oportunidades para startups verticais ou plataformas neutras de governança multi-agente que atuam entre Microsoft, Salesforce, Snowflake, Databricks e ferramentas nativas de agentes.
A Adyen planeja adquirir a startup de faturamento corporativo Orb por US$ 335 milhões em dinheiro, com o objetivo de integrar recursos de faturamento baseado em uso em tempo real à sua plataforma de pagamentos. O negócio, que ocorre após a recente aquisição da Talon.One pela Adyen, aponta para um movimento mais amplo de M&A à medida que a empresa preenche lacunas de produtos em faturamento, pagamentos, fidelidade e incentivos voltados para negócios digitais da era da IA.
Os serviços financeiros tradicionais enfrentam limitações devido a infraestruturas obsoletas, contas fragmentadas, horários de mercado restritos e liquidações lentas, enquanto a infraestrutura cripto possibilita finanças globais, instantâneas e interoperáveis. A visão da Coinbase para a Everything Exchange consiste em uma conta unificada que integra cripto, ações, ETFs, contratos futuros perpétuos, mercados de previsão, recompensas em USDC, acesso a DEX e inteligência de portfólio baseada em IA, com suporte futuro para agentes controlados pelo usuário capazes de realizar negociações em nome do cliente.
O dinheiro compra alívio, conforto e opções, mas não gera felicidade automática. É preciso decidir deliberadamente se vale a pena continuar jogando o jogo do mais, evitando que a riqueza consuma sua identidade e utilizando o capital para criar memórias, relacionamentos e significado em vez de cair no consumo por status ou lazer vazio.
A Stripe anunciou novas ferramentas voltadas para empresas do Reino Unido com o objetivo de facilitar vendas globais e aproveitar oportunidades no comércio via IA. As novidades incluem recursos expandidos de tesouraria multimoeda, defesas aprimoradas contra fraudes e a possibilidade de vender produtos por meio de múltiplos agentes de IA por meio de uma única integração.
O Barclays UK firmou um acordo para adquirir as operações da GoHenry no Reino Unido junto à Acorns. A conclusão da transação está prevista para o quarto trimestre de 2026, estando o negócio sujeito às aprovações regulatórias necessárias.
A Current, aplicativo de finanças pessoais dos Estados Unidos, captou US$ 80 milhões em uma rodada de financiamento Série E, atingindo uma avaliação de US$ 1,5 bilhão. A rodada foi liderada pela Springcoast Partners e foi concretizada em conjunto com uma parceria de financiamento ampliada com o Cross River.
O Ramp SWE-Bench é um benchmark privado composto por 80 tarefas de backend produzidas pelo Inspect, o agente de codificação interno da Ramp, após revisão de engenheiros. O benchmark avalia a performance de agentes em fluxos de software financeiro, como autorização de cartões, pagamentos, contabilidade, compras, tesouraria e prevenção a fraudes. A pontuação é baseada na capacidade do agente de entregar um patch pronto para revisão que corrija falhas em testes dentro de 45 minutos.