Voltar
Construindo o Dataset UMI Mais Diverso para Robótica

Pantheon Revoluciona Coleta de Dados Robóticos com DataSet UMI Inovador

Aprofundamento CEVIU

Aprofundamento

A Pantheon está redefinindo a coleta de dados para robótica com seu DataSet UMI, o Universal Manipulator Interface. A empresa não apenas construiu uma operação robusta, mas a customizou do zero: infraestrutura, hardware UMI próprio e até firmware de câmera. Isso permitiu uma redução drástica nos custos, de US$ 60/hora para apenas US$ 10/hora, mantendo a alta diversidade de tarefas. Em apenas oito semanas, a equipe coletou mais de um milhão de tarefas únicas, focando em superar as limitações dos conjuntos de dados tradicionais, que são geralmente repetitivos e pouco variados.

A metodologia da Pantheon combina abordagens de formato livre, onde os operadores realizam tarefas aleatórias com objetos, e roteirizadas, gerenciadas por uma plataforma interna chamada Nomos. O Nomos gera milhões de tarefas distintas e garante que sejam fisicamente possíveis, otimizando a categorização da manipulação e adaptando a coleta às necessidades de pesquisa. Curiosamente, a empresa fez uma aposta alta no uso de Modelos de Linguagem de Visão (VLMs) para anotação e controle de qualidade, uma aposta que se pagou em poucos meses, tornando a coleta em larga escala de dados brutos uma realidade. Isso é crucial para o treinamento de modelos de IA para manipulação destreza, permitindo que robôs aprendam com falhas e recuperações, algo que dados de 'sucesso' não proporcionavam.

O que mudou

A grande virada que a Pantheon entrega é a eficiência e o custo. Anteriormente, dados de teleoperação, que já representavam um avanço em relação a métodos mais antigos, tinham seus custos de coleta caindo de US$ 340/hora para US$ 118/hora, conforme noticiamos em agosto de 2026 sobre o cenário da Robótica e IA Física. A Pantheon agora pulveriza essa barreira, atingindo apenas US$ 10/hora, uma redução impressionante. Essa queda drástica supera não só os custos de teleoperação, mas também os de datasets UMI existentes, que giravam em torno de US$ 60 a US$ 150/hora, e eram considerados caros e pouco diversos.

Além da economia, a Pantheon demonstra a concretização da aposta em VLMs para processamento de dados. A empresa revelou que esperava que os VLMs amadurecessem para anotação e controle de qualidade, o que antes era um gargalo. A notícia de hoje mostra que essa tecnologia atingiu o nível esperado, validando o modelo de coleta de dados brutos e massivamente diversos. Isso representa uma evolução significativa na forma como a IA processa os próprios dados para treinar modelos de manipulação destreza, tornando-a mais autônoma e escalável. Essa abordagem também se distancia da dependência exclusiva de dados gerados por robôs ou de extensas equipes humanas para anotação, como vimos em projetos anteriores, ao mesmo tempo em que oferece uma alternativa mais estruturada à simples coleta de vídeos da internet.

Por que isso importa

A iniciativa da Pantheon é um marco fundamental na corrida pela IA física. O custo e a qualidade dos dados são os principais gargalos para o desenvolvimento de robôs mais autônomos e capazes. Ao reduzir drasticamente o custo de coleta de dados de alta qualidade para manipulação destreza, a Pantheon não apenas acelera suas próprias pesquisas, mas também democratiza o acesso a essa infraestrutura. Mais empresas e pesquisadores poderão treinar modelos de IA complexos sem o peso financeiro anterior.

A capacidade de coletar dados altamente diversos, incluindo falhas e recuperações, é crucial para que os robôs aprendam a navegar e interagir com o mundo real de forma mais resiliente. Em um cenário onde soluções como o Index da Figure e o RoboTok da Rice University buscam massificar a coleta de dados por meio de crowdsourcing ou vídeos da internet, a Pantheon oferece uma abordagem controlada e otimizada que gera dados específicos para manipulação, com um nível de granularidade e diversidade técnica que complementa e eleva o padrão para o treinamento de modelos de base para robótica, como o Robotics-1 da Xiaomi.

Linha do tempo

  1. Sunday Robotics busca construir robôs domésticos sem dados gerados por robôs.

  2. Xiaomi lança Robotics-1, um modelo de base para robôs com 100 mil horas de dados.

  3. Custos de teleoperação para robótica caem, indicando demanda por dados eficientes.

  4. Figure lança Index, plataforma crowdsourced para coleta de dados em robótica.

  5. RoboTok da Rice University permite IA robótica aprender com vídeos da internet.

  6. Pantheon revoluciona coleta de dados UMI, reduzindo custos para US$ 10/hora.

Perguntas frequentes

O que é o Universal Manipulator Interface (UMI)?

UMI é uma interface padronizada que permite a coleta de dados de manipulação robótica de forma mais escalável e eficiente. Ela serve como uma ponte entre a facilidade de coleta de dados egocêntricos (visão em primeira pessoa) e a relevância de dados teleoperados, focando em ações de garra e movimentos da extremidade do braço robótico.

Como a Pantheon conseguiu reduzir os custos de coleta de dados de US$ 60/hora para US$ 10/hora?

A empresa customizou toda a sua infraestrutura, incluindo hardware UMI próprio e firmware de câmera específico. Além disso, eles otimizaram as operações de coleta, usaram uma combinação de dados de formato livre e roteirizados, e fizeram uma aposta bem-sucedida em Modelos de Linguagem de Visão (VLMs) para anotação e controle de qualidade, eliminando custos de terceirização.

Por que a diversidade de tarefas nos dados é tão importante para a IA robótica?

A diversidade é crucial para treinar modelos de IA que possam generalizar tarefas e lidar com situações imprevistas no mundo real. Diferente de dados repetitivos, um dataset diverso, que inclui diferentes objetos, ambientes e até mesmo falhas, permite que os robôs aprendam a se adaptar e a se recuperar de erros, tornando-os mais robustos e independentes.

Qual o papel dos Modelos de Linguagem de Visão (VLMs) na estratégia da Pantheon?

A Pantheon apostou que os VLMs atingiriam a capacidade de anotar e verificar a qualidade dos dados de forma precisa e econômica. Essa aposta se confirmou. Os VLMs agora processam os dados brutos de formato livre, segmentando sucessos e falhas, o que permite que os modelos de IA aprendam sobre a evolução do mundo durante erros e como se recuperar, sem que o robô seja programado para falhar.

Fontes

Avalie este artigo:
Categoria
CEVIU IA
Publicado
07 de outubro de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser