Voltar
Meta lança Segment Anything Model (SAM) 3.1 com detecção e rastreamento avançados

Meta Atualiza Segment Anything Model (SAM) com Novas Capacidades de Detecção e Rastreamento

Aprofundamento CEVIU

Aprofundamento

O Segment Anything Model (SAM) 3.1 da Meta chega para solidificar a estratégia de oferecer modelos de percepção de ponta via API. Este não é um modelo multimodal qualquer. Ele foi construído sobre a arquitetura DETR, focada em detecção, segmentação e rastreamento de objetos. Isso significa que, diferente de outros modelos que apenas fornecem caixas delimitadoras, o SAM 3.1 entrega máscaras de segmentação pixel a pixel e mantém a identidade dos objetos em vídeos, tudo em uma única chamada. Sua otimização para inferência direto na API dispensa qualquer ajuste ou hospedagem local, permitindo que desenvolvedores integrem a funcionalidade em seus produtos desde o primeiro dia.

O grande diferencial está na capacidade de usar prompts textuais para interagir com o modelo, tornando a detecção e o rastreamento intuitivos. Isso abre portas para aplicações sofisticadas em visão computacional, desde automação industrial até análise de conteúdo, sem a necessidade de dados de treinamento específicos ou fine-tuning por parte do usuário.

O que mudou

A grande novidade do SAM 3.1 é a consolidação de uma plataforma unificada de IA da Meta. Observamos, por exemplo, o lançamento do Muse Spark 1.1 em 10 de julho de 2026, com foco em raciocínio multimodal e tarefas agentic, e os anúncios do Muse Image em 11 de julho e 27 de agosto de 2026, para geração e edição de imagens. Agora, o SAM 3.1 se integra de forma transparente a essa mesma Meta Model API. Isso significa que, para os desenvolvedores que já usam o Muse Spark para raciocinar ou o Muse Voice Transcribe para transcrição de fala, a adição de capacidades de percepção como detecção, segmentação e rastreamento se encaixa perfeitamente no fluxo de trabalho já existente. A Meta está construindo um ecossistema coeso de modelos, onde a interoperabilidade é a chave.

Por que isso importa

A chegada do SAM 3.1 é um passo importante na democratização de ferramentas avançadas de visão computacional. Com uma precificação competitiva (US$ 2,50 por mil imagens ou US$ 0,20 por mil quadros de vídeo), a Meta torna esta tecnologia acessível a um leque maior de desenvolvedores e empresas. Isso acelera a criação de novas aplicações que exigem compreensão visual precisa, desde segurança e monitoramento até criação de conteúdo e assistência robotizada. A facilidade de integração e o baixo custo de entrada diminuem barreiras para a inovação, permitindo que mais projetos se beneficiem da percepção visual avançada sem a complexidade de gerenciar modelos ou infraestrutura.

Linha do tempo

  1. Meta anuncia Muse Spark 1.1 e libera API de modelos.

  2. OpenAI lança GPT-Realtime-2.1-mini com raciocínio e uso de ferramentas.

  3. Meta expande acesso ao Muse Image em seus aplicativos.

  4. Meta revela Muse Image com 'grounding' em buscas para geração de imagens.

  5. Meta lança Segment Anything Model (SAM) 3.1 na API com novas capacidades.

Perguntas frequentes

O que é o Segment Anything Model (SAM) 3.1?

SAM 3.1 é a versão mais recente do modelo de percepção da Meta, otimizado para detecção, segmentação e rastreamento de objetos em imagens e vídeos. Ele permite aos usuários identificar e monitorar objetos com precisão usando prompts textuais, operando via Meta Model API.

Quais são as principais capacidades técnicas do SAM 3.1?

Baseado na arquitetura DETR, o SAM 3.1 oferece detecção e segmentação pixel a pixel, além de rastrear a identidade dos objetos em sequências de vídeo. Ele funciona em modo zero-shot, sem necessidade de dados de treinamento ou fine-tuning, e é otimizado para inferência de alta performance.

Como o SAM 3.1 se integra com outros modelos da Meta?

Ele é parte da Meta Model API, compartilhando a mesma infraestrutura de envelope, chaves, documentação e faturamento que outros modelos Meta. Isso permite que desenvolvedores combinem SAM 3.1 com o Muse Spark para raciocínio ou Muse Voice Transcribe para transcrição de fala, por exemplo, criando fluxos de trabalho mais complexos e eficientes.

Qual o custo para usar o SAM 3.1?

O uso do SAM 3.1 é precificado em US$ 2,50 por mil imagens processadas ou US$ 0,20 por mil quadros de vídeo. Esta estrutura de custos visa democratizar o acesso à tecnologia avançada de visão computacional da Meta.

Fontes

Avalie este artigo:
Categoria
CEVIU IA
Publicado
21 de setembro de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser