A China restringiu as viagens internacionais para profissionais de IA de alto nível em empresas privadas. Esses indivíduos precisarão de aprovação das autoridades competentes antes de viajar para o exterior. Os profissionais afetados incluem uma mistura de fundadores de startups, pesquisadores e executivos. Embora a China já tenha restringido viagens para pessoal chave – desde pesquisadores proeminentes até cientistas nucleares e executivos de empresas estatais –, é incomum que tais restrições se estendam a empresas privadas.

CEVIU IA
Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados
2317 notícias
A Apple planeja aprimorar suas ferramentas de imagem baseadas em IA, Genmoji e Image Playground, no iOS 27, com foco em elevar a qualidade visual e o realismo.
O Grok Build, um novo agente de codificação e interface de linha de comando (CLI), foi lançado em beta para assinantes do SuperGrok e X Premium Plus. Ele oferece suporte a projetos de codificação complexos, permitindo revisões no modo de planejamento e se integrando de forma contínua às convenções do usuário. Os usuários podem usar as capacidades do Grok para automação e processamento paralelo através do modo headless e de subagentes especializados.
O Papa Leão XIV divulgou recentemente um documento sobre a ética da integração da IA na sociedade moderna. O texto aborda o impacto ambiental da tecnologia, os riscos de sistemas algorítmicos que tomam decisões que afetam a vida das pessoas, e discute como a IA amplifica o poder daqueles com mais recursos, entre outros pontos. Um link para o documento está disponível no artigo, que apresenta um estilo de escrita acessível, mesmo para não-católicos.
O mercado está se tornando uma stack de problemas de memória. O hardware muda lentamente, enquanto o software e as arquiteturas de modelo podem evoluir rapidamente. Empresas de hardware precisarão construir arquiteturas que permaneçam úteis à medida que o gargalo se desloca.
Zvi avalia o Gemini 3.5 Flash como o melhor modelo em seu patamar de velocidade, embora não seja tão convincente quanto o Opus 4.7 ou GPT-5.5 em workloads que não são sensíveis à latência. O Google o posiciona como um "daily driver" para fluxos de trabalho "agentic", superando o 3.1 Pro em Terminal-Bench e MCP Atlas, enquanto roda 4x mais rápido.
A destilação on-policy treina um modelo aluno usando trajetórias amostradas de sua própria policy, enquanto um modelo professor fornece supervisão densa em nível de token por meio de regularização baseada em KL. Isso resolve a incompatibilidade de distribuição entre treinamento e inferência que afeta os métodos off-policy. Sua formulação canônica unifica as perdas forward-KL, reverse-KL e JSD, com a reverse-KL emergindo como o padrão para alunos menores em busca de modos específicos. A técnica pode ser implementada com uma simples troca de código do modelo regularizador em um stack de RL como Tinker.
O BenchBench é um novo benchmark que avalia a capacidade dos modelos de IA de criar outros benchmarks. Ele funciona como uma ótima métrica tanto para as habilidades dos modelos quanto para testar sua autoconsciência, focando na criatividade e não apenas na capacidade de resolução de problemas. Nos testes, apenas o GPT 5.2 se destacou, enquanto outros modelos, como o Opus 4.6 e o GPT 5.5, tiveram dificuldades em desenvolver um benchmark realmente útil e desafiador para terceiros.
O AlphaProof Nexus do Google DeepMind resolveu autonomamente nove dos 353 problemas Erdős abertos, incluindo questões sem resposta por décadas, com custos de inference de algumas centenas de dólares por problema.
O GPT-5.6 parece ter um forte foco em raciocínio multi-etapas mais robusto, melhores fluxos de trabalho agentic e capacidades aprimoradas de geração de frontend.
Os mercados de previsão não conseguiram concretizar a visão de Robin Hanson de 1990 para o "Idea Futures".
A DeepSeek pretende viabilizar um ecossistema chinês de hardware de IA avaliado em US$10 trilhões e alcançar uma avaliação de US$1 trilhão para si mesma.
A Anthropic está a caminho de gerar US$ 10,9 bilhões em receita no segundo trimestre, um aumento em relação aos US$ 4,8 bilhões no primeiro trimestre, com um crescimento mais rápido do que a Zoom no auge da pandemia. O fator decisivo para a empresa se tornar lucrativa foi a redução dos custos de compute, que caíram de 71 centavos de compute por dólar de receita no primeiro trimestre para 56 centavos no segundo. Apenas o Claude Code é responsável por US$ 2,5 bilhões em receita, e a empresa espera um lucro de US$ 559 milhões a tempo de seu IPO em outubro. A narrativa de que "laboratórios de IA queimam dinheiro para sempre" finalmente tem uma exceção.
A DeepSeek cortou permanentemente os preços do seu modelo V4 Pro em 75%, uma promoção que inicialmente terminaria no final do mês. Com essa precificação, a DeepSeek se posiciona abaixo dos modelos de IA líderes como GPT-5 da OpenAI, Claude Opus 4.7 da Anthropic e Gemini 3.5 Flash do Google. A diferença de custo é mais significativa quando comparada aos modelos de raciocínio de fronteira (frontier reasoning models) que empresas utilizam para workloads mais exigentes.
O Mythos Preview é capaz de transformar vulnerabilidades em primitivos de exploit e combinar esses primitivos em cadeias de ataque completas de ponta a ponta. O conhecimento e a expertise necessários para desenvolver exploits diminuirão significativamente à medida que as capacidades do modelo se tornarem mais amplamente disponíveis. Este artigo analisa o desempenho do modelo no ExploitBench e no ExploitGym, dois benchmarks acadêmicos mais novos e desafiadores. O Mythos Preview supera consistentemente todos os outros modelos avaliados nesses testes.
A análise qualitativa envolve examinar grandes volumes de dados não estruturados para identificar padrões interessantes, recorrentes, surpreendentes ou importantes. Uma questão de pesquisa central atualmente é como realizar a análise qualitativa de forma eficaz com a ajuda de agentes de IA. Este artigo aborda o contexto do campo, propõe uma configuração experimental e discute os próximos passos. Embora ainda não esteja claro se os agentes de IA podem substituir humanos na análise qualitativa, eles já conseguem executar as partes mecânicas do processo rapidamente, embora sem a capacidade de discernimento humano.
A release candidate da próxima especificação do Model Context Protocol (MCP) já está disponível. Esta é a maior revisão do protocolo desde seu lançamento. A versão candidata introduz um core stateless que escala em infraestrutura HTTP comum, extensões, autorização que se alinha mais de perto com deployments de OAuth e OpenID Connect, uma política formal de deprecation, e muitas outras alterações. Ela contém breaking changes. A especificação final será lançada em 28 de julho.
A OpenAI descreveu um workflow de macro-avaliação para sistemas agentic que analisa padrões em populações inteiras de traces, em vez de falhas isoladas. Este método permite uma compreensão mais abrangente do comportamento e desempenho desses sistemas complexos.
O capitalista de risco David Sacks alertou o Presidente Trump, em uma ligação, que a aguardada ordem executiva sobre os perigos da inteligência artificial, que Trump estava deliberando, poderia levar a regulamentações obrigatórias que desacelerariam a indústria em sua corrida com os concorrentes chineses. Trump respondeu que compartilhava das preocupações sobre a China e estava preocupado em dificultar o investimento em IA. Ele então adiou a assinatura e disse a repórteres que não assinaria a ordem. O incidente demonstra a poderosa influência de Sacks e representa uma vitória para aqueles que se opõem a fortes guardrails para limitar os riscos apresentados pela tecnologia.
A Anthropic parece estar expandindo a disponibilidade de seu modelo Claude Mythos, que agora auxiliará na proteção de um número maior de organizações. Indícios do modelo já foram encontrados em plataformas como Google Cloud e AWS, por meio de programas de descoberta de vulnerabilidades. Um lançamento do Mythos 1 parece iminente. Rumores também indicam que o Claude Opus 4.8 está em desenvolvimento para ser lançado em breve.





