Introdução
O Google DeepMind acaba de anunciar o lançamento do Gemini Robotics ER 2, um modelo de inteligência artificial que promete revolucionar a forma como robôs interagem com o mundo físico. Esta nova geração representa um salto significativo em relação ao ER 1.6, introduzindo capacidades de compreensão de vídeo em tempo real, orquestração de tarefas complexas e, pela primeira vez, colaboração nativa entre múltiplos robôs. Para o mercado brasileiro, que vem investindo cada vez mais em automação industrial e logística, essa tecnologia pode representar um divisor de águas na eficiência operacional.
O Gemini Robotics ER 2 funciona como um ‘cérebro de alto nível’ para robôs, permitindo que eles conversem naturalmente com humanos, compreendam o ambiente físico ao seu redor e planejem sequências complexas de ações. O modelo está disponível publicamente através da API do Gemini, Google AI Studio e na plataforma Gemini Enterprise Agent, democratizando o acesso a tecnologias de ponta em robótica.
Arquitetura e capacidades técnicas revolucionárias
A principal inovação do Gemini Robotics ER 2 está em sua capacidade de processar fluxos contínuos de vídeo para monitorar o próprio progresso em tempo real. Diferentemente de modelos anteriores que dependiam de snapshots estáticos, o ER 2 consegue identificar quando algo dá errado durante uma tarefa e se adaptar instantaneamente. Imagine um robô servindo café que percebe que está derramando o líquido – ele pode parar imediatamente e corrigir sua ação, sem precisar reiniciar todo o processo.
O modelo utiliza a infraestrutura do Gemini Live API, otimizada para tarefas sensíveis à latência. Isso elimina as pausas incômodas de ‘parar e pensar’ que caracterizavam gerações anteriores de robôs inteligentes. Em demonstrações práticas, o Google mostrou o sistema funcionando com o robô Spot da Boston Dynamics, onde comandos de voz natural como ‘pegue a pipoca’ são executados fluidamente através da orquestração de APIs de navegação e manipulação.
Uma característica técnica fundamental é a integração com modelos Vision-Language-Action (VLA) existentes. O Gemini Robotics ER 2 não substitui esses modelos de controle motor de baixo nível, mas atua como um orquestrador inteligente, decidindo quando e como ativá-los. Isso permite que empresas aproveitem investimentos existentes em robótica enquanto adicionam uma camada de inteligência superior.
Inteligência temporal: o segredo para tarefas complexas
Um dos maiores desafios em robótica sempre foi determinar quando uma tarefa está realmente concluída. O Gemini Robotics ER 2 introduz duas capacidades fundamentais nessa área: classificação contínua de progresso e identificação precisa de momentos críticos.
A classificação de progresso permite que o robô quantifique em tempo real o quanto de uma tarefa foi completado, dividindo-a em cinco níveis percentuais (0-20%, 20-40%, etc.). Nos testes, o modelo alcançou 57,4% de precisão nessa tarefa, superando significativamente modelos concorrentes. Para contexto, isso significa que um robô apertando uma lâmpada sabe exatamente quando parar para não quebrar o bulbo, ou um robô amarrando um saco de lixo consegue verificar se o nó está adequadamente apertado.
A capacidade de ‘moment-finding’ é ainda mais impressionante. O modelo consegue identificar o frame exato de vídeo onde um evento crítico ocorre – como o momento preciso para parar de despejar líquido em um copo. Com 91,3% de precisão e latência média de apenas 0,96 segundos, o Gemini Robotics ER 2 compete com modelos muito maiores, mas entrega essa performance com uma fração do custo computacional e quatro vezes mais velocidade de execução.
Colaboração multi-robô: o futuro da automação
Talvez a inovação mais empolgante seja a capacidade nativa de colaboração entre múltiplos robôs. O Gemini Robotics ER 2 permite que diferentes tipos de máquinas – um robô com rodas para ambientes internos e um humanóide para terrenos irregulares, por exemplo – trabalhem juntos através de uma compreensão semântica compartilhada.
Em demonstrações com o Apollo 2 da Apptronik e o Franka F3 Duo, o sistema mostrou robôs passando tarefas entre si de forma coordenada, completando workflows complexos que seriam impossíveis para uma única máquina. Para indústrias brasileiras que operam com diferentes tipos de equipamentos robóticos, isso abre possibilidades de integração sem precedentes.
A comunicação entre robôs acontece através de uma linguagem semântica de alto nível, não dependendo de protocolos proprietários específicos. Isso significa que robôs de diferentes fabricantes podem potencialmente trabalhar juntos, desde que estejam conectados ao sistema Gemini Robotics ER 2.
Segurança aprimorada para ambientes com humanos
A segurança sempre foi uma preocupação primária quando robôs operam próximos a humanos. O Gemini Robotics ER 2 estabelece novos padrões nessa área, com melhorias significativas em dois benchmarks críticos: Safety Instruction Following e Human Proximity.
O modelo consegue detectar automaticamente quando uma pessoa está próxima e pausar operações potencialmente perigosas, retomando o trabalho apenas quando a área está livre. Isso é fundamental para ambientes de manufatura e logística onde humanos e robôs compartilham o mesmo espaço. O Google publicou um relatório técnico detalhado sobre segurança, estabelecendo benchmarks para avaliar a capacidade de modelos de IA atuarem como orquestradores seguros de robôs.
As melhorias de segurança não se limitam apenas à detecção de proximidade. O modelo também avalia a viabilidade física de comandos antes de executá-los e busca esclarecimento humano quando encontra ambiguidades. Por exemplo, se alguém pedir para o robô ‘pegar o copo’, mas houver múltiplos copos disponíveis, o sistema solicitará clarificação ao invés de escolher arbitrariamente.
Implicações para o mercado brasileiro
Para o Brasil, que vem aumentando investimentos em automação para competir globalmente, o Gemini Robotics ER 2 representa uma oportunidade única. Setores como agronegócio, manufatura e logística podem se beneficiar imediatamente dessa tecnologia. Imagine robôs em armazéns que não apenas movem caixas, mas entendem instruções complexas em português, adaptam-se a mudanças no ambiente e colaboram eficientemente.
A disponibilidade através de APIs públicas democratiza o acesso, permitindo que startups e empresas de médio porte experimentem com robótica avançada sem os custos proibitivos de desenvolvimento proprietário. Universidades e centros de pesquisa brasileiros também podem utilizar a plataforma para acelerar projetos de robótica, aproveitando um modelo de ponta sem precisar treinar sistemas do zero.
O modelo suporta interações em múltiplos idiomas, incluindo português, o que elimina barreiras linguísticas que historicamente limitaram a adoção de tecnologias robóticas importadas. Isso é particularmente relevante para treinamento de operadores e integração em ambientes onde nem todos os funcionários dominam inglês técnico.
Conclusão
O Gemini Robotics ER 2 representa um marco importante na evolução da robótica inteligente. Ao combinar compreensão de vídeo em tempo real, orquestração sofisticada de tarefas e colaboração multi-robô, o Google DeepMind está efetivamente criando uma nova categoria de inteligência física. Para empresas brasileiras, isso significa robôs que não apenas executam tarefas repetitivas, mas que podem verdadeiramente colaborar com humanos e entre si para resolver problemas complexos.
A tecnologia ainda está em seus estágios iniciais, mas o potencial disruptivo é evidente. À medida que mais desenvolvedores e empresas começarem a experimentar com o Gemini Robotics ER 2, podemos esperar uma aceleração significativa na adoção de robótica inteligente em diversos setores. O futuro onde robôs trabalham lado a lado com humanos de forma segura e produtiva está mais próximo do que nunca, e o Brasil tem a oportunidade de ser protagonista nessa transformação.
Fonte original: Este artigo foi adaptado e traduzido a partir da matéria publicada em Google DeepMind, disponível em https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/.



