O Thinking Machines Lab apresentou uma prévia de pesquisa dos modelos de interação para colaboração humano-IA em tempo real através de áudio, vídeo e texto. Os modelos são treinados do zero com design multi-stream para responsividade em tempo real, permitindo troca constante e eliminando as limitações tradicionais baseadas em turnos. Esta abordagem escalável promete maior interatividade e inteligência com aplicações práticas em diversos domínios.

CEVIU IA
Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados
2317 notícias
O modelo de vídeo Gemini Omni do Google apareceu antes do I/O, integrando remix e edição de vídeo diretamente no chat. O feedback inicial destaca suas capacidades de edição robustas, como remoção de marca d'água e troca de objetos, embora fique atrás na qualidade cinematográfica bruta comparado a concorrentes como o Seedance 2 da ByteDance. O modelo pode ser lançado em versões escalonadas, possivelmente Flash e Pro, como parte de uma estratégia mais ampla para unificar modalidades sob o Gemini.
A AWS detalhou como o scaling de foundation models evoluiu além do pré-treinamento para incluir pós-treinamento e test-time compute, junto com a infraestrutura distribuída necessária para suportar cada estágio de forma eficiente.
O IPO em alta da Cerebras sinaliza uma divisão entre "inference para respostas" otimizada para velocidade de tokens e "inference para agentes" otimizada para hierarquia de memória. O WSE-3 da Cerebras tem 44GB de SRAM on-chip a 21 PB/s, aproximadamente 6.000 vezes a largura de banda de memória de um H100, sendo perfeito para respostas de baixa latência voltadas ao usuário, incluindo voz e wearables de IA, mas inadequado quando caches KV e pesos do modelo excedem a capacidade on-chip.
O A²RD introduz um framework agentic de diffusion autoregressive para gerar vídeos longos e coerentes através de retrieval iterativo, síntese, refinamento e atualizações de memória.
Os Normalizing Trajectory Models substituem os passos padrão de denoising do diffusion por normalizing flows condicionais, permitindo geração de imagens em quatro passos enquanto mantêm treinamento de likelihood exato e suportam self-distillation.
Bedi executa um ciclo completo de desenvolvimento de agentes através de cinco prompts do Claude Code que estruturam, endurecem contra especificações, adicionam capacidades, corrigem falhas de avaliação e reconciliam divergências entre documentação, código e configuração em sua plataforma baseada em Agno. O loop Improve deriva 8-12 testes das instruções do agente, executa cada um contra o container ativo via cURL, julga PASS ou FAIL dos logs do container, então itera até cinco rodadas escolhendo alavancas como endurecer regras, trocar ferramentas ou aumentar num_history_runs até os testes passarem, enquanto Hill Climb executa a suíte de avaliação salva e corrige regressões no local.
Olivia Moore da a16z migrou seus workflows agentic do Claude Cowork e Claude no Chrome para o Codex da OpenAI, recomendando que a maioria dos trabalhadores do conhecimento não-técnicos faça o mesmo. Com o app desktop de fevereiro, Plugins e Automations, o Codex consolida a troca entre interfaces ChatGPT-Claude-Cowork em um só produto. O Codex oferece Skills instaláveis com um clique que ela espera que ancorem um marketplace interno e entre usuários, considerando que as taxas de tentativa de setup de Skills por não-programadores provavelmente ficam abaixo de 10% no Claude. Os Codex Pets fornecem atualizações de status de tarefas com baixo atrito para usuários que não vivem em um IDE.
A IA carece de criatividade semelhante à humana devido à ausência de impulsos intrínsecos e experiências subjetivas. Emular sentimentos poderia aprimorar as capacidades criativas da IA, mas levanta questões éticas. Projetar IA para genuinamente sentir e desejar pode levar a consequências não intencionais, similar à responsabilidade vista na parentalidade.
Ilya Sutskever, cofundador e ex-cientista-chefe da OpenAI, é um dos maiores acionistas individuais da startup de IA.
O ChatGPT 5.5 Pro demonstrou ser capaz de produzir uma pesquisa de nível de doutorado em aproximadamente uma hora, sem exigir contribuição matemática substancial de um ser humano. Inicialmente, as afirmações de que os LLMs poderiam resolver problemas de pesquisa eram recebidas com ceticismo, visto que muitas das soluções já estavam disponíveis na literatura ou eram facilmente dedutíveis. No entanto, a situação evoluiu para um ponto onde, se um problema apresentar um argumento direto que, por algum motivo, matemáticos humanos não identificaram, existe uma boa probabilidade de que os LLMs o detectem. Esta publicação examina o desempenho do ChatGPT 5.5 Pro diante de uma série de problemas selecionados.
A Nvidia já realizou mais de US$ 40 bilhões em investimentos este ano, consolidando-se como a maior vencedora do boom da IA até agora. A corrida global para garantir GPUs impulsionou as ações da empresa em mais de 11 vezes nos últimos quatro anos. Para assegurar sua dominância para além dos chips, a empresa está financiando toda a cadeia de suprimentos de IA, garantindo que ela opere com hardware Nvidia.
Grandes laboratórios estão direcionando seus modelos para um número limitado de casos de uso, ao mesmo tempo em que treinam seus designs de harness nos modelos. Isso os torna menos generalizados, o que pode facilitar a construção de aplicações para algumas empresas, mas o compromisso resultante é o lock-in.
Este post contém um guia sobre hardware para inferência local de LLMs.
A Allen AI lançou o EMO, um modelo Mixture-of-Experts que aprende a organização modular dos especialistas diretamente dos dados de pré-treinamento, em vez de domínios predefinidos. Tarefas podem ser executadas utilizando apenas 12,5% dos especialistas, mantendo um desempenho próximo ao do modelo completo.
SkillOS introduziu um framework de aprendizado por reforço que treina agentes para curar skills reutilizáveis a partir de experiências passadas. O sistema aprimorou o desempenho em tarefas de longo prazo ao evoluir repositórios de skills estruturados que se generalizam entre modelos e domínios.
Diferentes métodos de pós-treinamento, como SFT, RL e On-Policy Distillation, remodelam a distribuição de um modelo de maneiras distintas, impactando o desempenho e o risco de catastrophic forgetting. A RL atualiza políticas usando recompensas de amostras da política atual, promovendo o desempenho da tarefa enquanto minimiza o esquecimento, ao contrário do SFT, que tende a puxar para dados externos, arriscando as capacidades existentes. Experimentos demonstram que o On-Policy Distillation pode superar seus teachers, sugerindo que a amostragem de dados on-policy preserva crucialmente as capacidades, tornando-a um ingrediente chave para futuros designs de algoritmos.
Um guia de engenharia da OpenAI para a construção de sistemas de tradução de fala ao vivo, utilizando o gpt-realtime-translate. Este modelo foi otimizado especificamente para interpretação simultânea, diferenciando-se de interações de voz baseadas em turnos.
O Google lançou o Gemini 3.1 Flash-Lite, agora acessível globalmente via Google Cloud. Desenvolvido para latência ultrabaixa e tarefas de alto volume, este modelo é direcionado a setores como engenharia de software e serviços financeiros, oferecendo tempos de resposta sub-segundo e mantendo a latência p95 em torno de 1.8 segundos. O Gemini 3.1 proporciona velocidade, custo e desempenho cognitivo aprimorados, com suporte a tarefas multimodais, tornando-o ideal para operações de desenvolvedores e atendimento ao cliente em tempo real.
A Akamai garantiu a Anthropic como cliente, com a Anthropic se comprometendo a gastar US$ 1,8 bilhão nos serviços da Akamai ao longo de sete anos. A Anthropic tem se esforçado para aumentar sua capacidade de compute devido a reclamações generalizadas sobre os limites de uso do Claude. Somente neste mês, a Anthropic fechou ou expandiu acordos com CoreWeave, Amazon, Google, Broadcom e xAI.





