CEVIU IA
Todas as notícias

CEVIU IA

Lançamentos, inovações e pesquisas para profissionais de IA, machine learning e ciência de dados

2347 notícias

Um agente de IA é, essencialmente, um modelo aprimorado por um 'harness'. A engenharia de harness consiste em desenvolver sistemas que circundam esses modelos, transformando-os em verdadeiras ferramentas de trabalho eficientes. Enquanto a inteligência reside no modelo, é o harness que a torna funcional e aplicável. ️ Este artigo explora a fundo a natureza dos harnesses e detalha os componentes cruciais que os agentes de IA exigem para operar.

O navegador Comet AI da Perplexity foi impedido de acessar o site da Amazon. A Amazon processou a Perplexity em novembro, alegando que a startup ocultou seus agentes de IA para continuar a fazer scraping do site da Amazon sem aprovação. O navegador Comet permite aos usuários pedir ao assistente para encontrar itens na Amazon e realizar compras. A Amazon afirma que os agentes de IA da Perplexity representam um risco para os dados dos clientes e criam desafios para seu negócio de publicidade. A empresa tem bloqueado amplamente seus sites de compras para agentes de IA e impedido o acesso de dezenas deles. ️

Todo pipeline de treinamento de IA se baseia em uma camada de dados que determina o comportamento dos modelos. Esses dados definem o que os modelos conhecem, como raciocinam e o que podem fazer com segurança. No entanto, grande parte dos dados de treinamento atuais permanece opaca, fragmentada ou isolada entre equipes. O acesso a dados abertos oferece aos desenvolvedores um caminho mais rápido e econômico para construir modelos de alta qualidade. É por isso que a NVIDIA lança datasets abertos junto com seus modelos abertos, ferramentas e técnicas de treinamento.

Benchmarks de codificação agentic são frequentemente empregados para comparar as capacidades de engenharia de software de frontier models. Esses resultados são muitas vezes interpretados como medições precisas da capacidade relativa dos modelos. Contudo, pesquisas indicam que a configuração da infraestrutura por si só pode gerar variações significativas nos resultados. Embora os desenvolvedores de evals tenham começado a considerar esse fator, as soluções atuais podem, potencialmente, modificar o que esses benchmarks realmente avaliam. ️

A liderança do ChatGPT em engajamento é mais ampla do que sua liderança em participação de mercado. Sua taxa DAU:MAU é de 45% contra 22% do Gemini, e o WAU:MAU subiu de 50% em meados de 2023 para 82% atualmente, superando Gmail e Spotify e se aproximando do Instagram. A retenção na quarta semana de 66% supera todos os aplicativos corporativos do conjunto de dados e é mais que o dobro dos 24% do Perplexity, enquanto a maioria dos apps vê a retenção estabilizar em escala. O sinal mais raro é a "curva de sorriso" do ChatGPT: um dos únicos três produtos, junto com Gmail e Chrome, onde a retenção cai e depois se recupera, indicando que os lançamentos de produtos da OpenAI estão reativando ativamente usuários inativos, não apenas atraindo novos.

A Nvidia e o Thinking Machines Lab de Mira Murati estabeleceram uma parceria plurianual, na qual a startup implantará pelo menos um gigawatt de chips de ponta para treinar e servir seus frontier models . As empresas colaborarão no design de sistemas de treinamento e serving de IA utilizando a tecnologia da Nvidia. O acordo concede ao relativamente jovem laboratório de IA poder computacional para avançar em suas pesquisas e financiamento para sua equipe de 120 funcionários. A empresa compete acirradamente por talentos de pesquisa em IA, num cenário de avaliações que dispararam na indústria .

A ferramenta Codex pode ser utilizada para declarar impostos pessoais e demonstrou ser ainda mais precisa que um contador humano . O feedback imediato fornecido por Codex auxilia os usuários a compreender melhor sua situação fiscal e o código tributário . Ao ter acesso a detalhes pessoais, Codex consegue fazer suposições mais acertadas sobre o tratamento fiscal. Contadores provavelmente não precisam se preocupar: a maioria não se agrada de fazer declarações de imposto de renda pessoal, e suas outras responsabilidades tendem a ser muito mais difíceis de automatizar.

Modelos open source propõem distribuir o valor criado pela IA de forma mais ampla, permitindo que mais pessoas desenvolvam. Contudo, o ecossistema atual não facilita essa construção. O stack contém muitos bugs e há um débito técnico oculto em cada camada. Desenvolvedores precisam parar de apenas corrigir bugs e, em vez disso, construir um stack melhor. ️

O Gemini Embedding 2 do Google, acessível via Gemini API e Vertex IA, unifica texto, imagens, vídeos, áudio e documentos em mais de 100 idiomas. O modelo processa até 8.192 tokens de texto, seis imagens, vídeos de 120 segundos e PDFs de seis páginas, incorporando Matryoshka Representation Learning para dimensões de saída personalizáveis. Usuários em acesso antecipado já o utilizam para Retrieval-Augmented Generation e busca semântica, com feedback inicial indicando desempenho superior em relação aos concorrentes.

Um artigo recente da Forbes, baseado em informações sobre o Cursor, alegou que o plano Claude Code Max da Anthropic, no valor de US$ 200 por mês, poderia consumir até US$ 5.000 em compute . Contudo, é provável que as fontes do artigo estejam confundindo os preços de varejo da API com os custos reais de compute. O custo real de compute é estimado em aproximadamente 10% dos preços da API , e a maioria dos usuários não se aproxima de seus limites. Embora a Anthropic não seja uma empresa lucrativa, os custos de inference não são o principal motivo.

Pesquisadores do Google ensinaram LLMs a raciocinar de forma bayesiana, treinando-os para mimetizar as previsões de um modelo bayesiano ideal. A inferência bayesiana define a maneira ótima de realizar atualizações em múltiplas interações, o que poderia ajudar os LLMs a otimizar as interações com o usuário ao atualizar suas estimativas sobre as preferências. A abordagem dos pesquisadores melhora significativamente o desempenho dos LLMs em tarefas de recomendação e permite a generalização para outras tarefas, sugerindo que o método ensinou os LLMs a aproximar melhor o raciocínio bayesiano.

A Promptfoo, plataforma de segurança, avaliação e conformidade para aplicações de IA, anunciou sua aquisição pela OpenAI. A empresa, fundada em 2024 com o propósito de simplificar o teste sistemático de aplicações de IA para desenvolvedores, manterá seu status open source e continuará a servir sua base de usuários e clientes. A união com a OpenAI visa amplificar o impacto da Promptfoo na forma como as equipes desenvolvem e implementam sistemas de IA. A OpenAI planeja aprimorar e incorporar a tecnologia central da Promptfoo em suas camadas de modelo e infraestrutura, visando capacitar as equipes a detectar vulnerabilidades em estágios iniciais e garantir o lançamento de IA segura desde o princípio.

O uso de IA generativa em aplicações para consumidores evoluiu significativamente , com produtos como CapCut, Canva e Notion integrando a IA como recursos centrais. ChatGPT permanece o produto de IA líder globalmente, mas concorrentes como Gemini e Claude estão ganhando força, especialmente com assinaturas pagas nos EUA. O cenário da IA está se diversificando geograficamente e funcionalmente, com avanços notáveis na geração de vídeo e em sistemas agentic de IA, como OpenClaw, sugerindo uma mudança para além das métricas tradicionais de navegadores e aplicativos.

Agentes de codificação desmantelaram o processo tradicional em cascata, tornando a implementação mais barata e mudando o gargalo da escrita de código para a sua revisão. A alta produtividade se torna a nova restrição, beneficiando construtores com senso de produto e pensadores de sistemas capazes de gerenciar ciclos rápidos. Generalistas obtêm a maior vantagem ao eliminar a sobrecarga de comunicação, enquanto a exigência para a especialização pura aumenta, uma vez que a profundidade de domínio isolada já não é suficiente para justificar uma função.

O recurso de Revisão de Código para Claude Code ️ permite que desenvolvedores configurem revisões automatizadas de pull requests (PRs) que identificam erros de lógica, vulnerabilidades de segurança e regressões por meio de análise multi-agente . Ele analisa pull requests no GitHub e publica os resultados como comentários inline, que são etiquetados por gravidade. A ferramenta não aprova nem bloqueia PRs, garantindo que os fluxos de trabalho de revisão existentes permaneçam intactos. O Claude Review é faturado com base no uso de tokens, com o custo médio das revisões variando entre $15 e $25 .

Assistentes de IA geram 45 bilhões de sessões mensais, correspondendo a 56% do volume global de mecanismos de busca. Notavelmente, 83% do uso de IA ocorre em aplicativos móveis, com o ChatGPT dominando 89% das sessões globais de IA. Apesar da ascensão da IA, a atividade em mecanismos de busca tradicionais permanece crucial, com o uso combinado crescendo 26% globalmente desde 2023.

Outras categorias