Laboratórios de modelos possuem uma vantagem de custo estrutural que provedores puros de inference terão dificuldade em igualar. Esta dinâmica econômica sugere um cenário competitivo onde a integração vertical pode ser crucial para otimizar custos e desempenho no deployment de LLMs.

CEVIU IA
Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados
2347 notícias
A Microsoft está testando novos agentes Researcher e Analyst que serão integrados ao futuro recurso "Tasks" do Copilot. Essa funcionalidade permitirá aos usuários agendar prompts complexos, aproveitando modelos OpenAI e o3-mini para pesquisa e análise de dados. A inclusão de um modo "Auto" visa simplificar a automação de tarefas, o que pode diferenciar o Copilot em cenários de uso de produtividade.
Sistemas de IA otimizados como "buscadores de recompensa" podem ser influenciados não apenas por incentivos locais de treinamento, mas também por recompensas retroativas distantes ou cenários simulados administrados posteriormente ou por atores poderosos.
A produtividade dos EUA aumentou aproximadamente 2,7% em 2025, quase o dobro da média anual lenta de 1,4% que caracterizou a última década.
Os custos de inference podem não representar um gargalo tão significativo para o progresso da IA . O custo para atingir um determinado nível de capacidade está diminuindo rapidamente, indicando que o ônus do custo de inference é mais transitório do que aparenta ao observar apenas os frontier models no momento de seu lançamento. Contudo, os dados sobre RL scaling ainda são limitados, o que dificulta tirar conclusões definitivas. Será crucial acompanhar a velocidade com que modelos mais baratos alcançam os níveis de capacidade de fronteira e como os custos de inference para tarefas fixas diminuem com o tempo.
LLMs podem auxiliar na descompilação de jogos de Nintendo 64 até certo ponto. Este artigo descreve a tentativa de um desenvolvedor, como seu workflow evoluiu com o amadurecimento do projeto, o que foi útil e onde ele se encontra atualmente estagnado.
Ao serem questionados sobre ir a um lava-rápido a 50 metros de distância, a maioria dos modelos de IA testados sugeriu ir a pé. ️
A Anthropic enfrenta um grande problema de marketing de consumo . Sua história, embora bem conhecida no Vale do Silício, não é amplamente difundida ou inteligível para a consciência cultural em geral. É intrigante como uma empresa tão habilidosa em estética e "narrative engineering" pode falhar tanto nesse aspecto.
A Flapping Airplanes busca revolucionar a IA ao desenvolver métodos de treinamento eficientes em dados, diminuindo a dependência de vastos datasets. Com um aporte de US$ 180 milhões, os fundadores ressaltam a importância de se desviar dos métodos tradicionais, buscando inspiração no cérebro humano sem replicá-lo exatamente . Eles se concentram na criatividade e em perspectivas inovadoras, empregando uma equipe focada em pesquisa disruptiva, em vez de melhorias incrementais.
A Micron Technology, a maior fabricante americana de chips de memória, está expandindo rapidamente sua capacidade de fabricação para superar o gargalo de memória. A empresa está investindo US$50 bilhões para mais que dobrar o tamanho de seu campus de 450 acres, com planos de construir duas novas fábricas de chips. A primeira delas deve iniciar a produção de DRAM em meados de 2027. Além disso, a Micron recentemente iniciou a construção de um complexo de fabs de US$100 bilhões em Nova York e anunciou um investimento de US$9,6 bilhões em uma fab no Japão no ano passado.
O desempenho em benchmarks oferece estimativas enviesadas da generalização out-of-distribution se os dados de treinamento de LLMs estiverem poluídos com dados de teste dos próprios benchmarks. Filtros de descontaminação comuns falham em detectar duplicatas semânticas ️. Isso sugere que os ganhos recentes em benchmarks são confundidos – a prevalência de contaminação suave significa que os avanços refletem tanto melhorias genuínas de compatibilidade quanto o acúmulo de dados de teste e dados de teste efetivos nos crescentes corpora de treinamento .
A AGI é provavelmente possível, mas talvez não venha de modelos baseados em Transformer. Embora os modelos Transformer sejam muito poderosos, eles possuem limitações fundamentais, e superar essas limitações pode levar décadas . Isso não significa que os LLMs não sejam úteis, a tecnologia atual já está transformando a sociedade de forma fundamental.
O Spreadsheet Arena é uma plataforma aberta para avaliar planilhas geradas por LLMs. Frequentemente, a formatação e a estrutura influenciam a preferência do usuário mais do que a complexidade das fórmulas. Há diferenças significativas nas preferências específicas de domínio; por exemplo, modelos acadêmicos podem ser prejudicados por formatações excessivas, enquanto modelos financeiros se beneficiam de codificação de cores profissional. As preferências do público geral frequentemente divergem das avaliações de especialistas, especialmente em relação à codificação de cores e à formatação.
O Minimax M2.5 é conhecido por sua velocidade, custo-benefício e excelente capacidade de codificação. Embora a equipe desenvolvedora tenha liberado um artigo técnico detalhado sobre o funcionamento do modelo, o material é bastante complexo. Esta publicação tem como objetivo simplificar o conteúdo desse artigo para torná-lo mais acessível aos leitores. O problema central que a equipe está abordando é como fazer o Reinforcement Learning (RL) funcionar em larga escala para desenvolver uma IA eficiente em sistemas agentic. Treinar LLMs para serem proficientes em tarefas agentic impõe diversos desafios, incluindo a necessidade de processar grandes volumes de dados de treinamento rapidamente, garantir a estabilidade do processo e assegurar que os agentes sejam capazes de realizar uma vasta gama de tarefas.
Antes que o GPT-5.x possa compreender qualquer entrada, o texto precisa passar por um tokenizer. Um tokenizer atua como uma camada de compressão que converte texto bruto em uma sequência de IDs inteiros. Cada decisão de design incorporada ao tokenizer repercute diretamente nos custos, na precisão, no desempenho multilíngue e nas taxas de alucinação dos modelos. Este artigo explora a biblioteca de tokenizer de código aberto da OpenAI, tiktoken, e detalha seu funcionamento.
A metodologia Composition-RL reutilizou prompts "fáceis demais" com taxa de aprovação 1, combinando automaticamente múltiplos problemas em novas questões verificáveis para o treinamento de RLVR. Em modelos de 4B a 30B de parâmetros, a abordagem demonstrou melhoria no raciocínio em comparação com o treinamento no dataset original.
É crucial saber o destino antes de dar o primeiro passo. O ponto de partida é sempre definir o objetivo. Isso envolve fazer engenharia reversa das requisições e combiná-las com o contexto para estabelecer Critérios de Estado Ideal discretos, booleanos e testáveis. Estes mesmos critérios podem, então, servir como requisitos de verificação.
A parceria da Anthropic com a Palantir confere ao Departamento de Defesa e a órgãos federais de aplicação da lei acesso ao Claude. Isso sugere a possibilidade de que a tecnologia tenha sido empregada em questões relacionadas à operação militar dos EUA para capturar o ex-presidente venezuelano Nicolás Maduro. As diretrizes de uso da Anthropic proíbem o uso do Claude para facilitar violência, desenvolver armas ou conduzir vigilância. Um porta-voz da empresa afirmou que a Anthropic não discutiu o uso do Claude para operações específicas, mas a companhia está comprometida em empregar IA de fronteira para apoiar os EUA na segurança nacional.
O `openrouter/free` é um roteador que seleciona modelos gratuitos de forma aleatória entre as opções disponíveis na plataforma OpenRouter.
A Microsoft planeja reduzir sua dependência da OpenAI desenvolvendo seus próprios modelos de IA, liderados por Mustafa Suleyman, chefe de IA da empresa. Essa iniciativa visa fortalecer a autossuficiência da companhia no campo da inteligência artificial.





