Gemini Robotics ER 2: Google lança modelo de raciocínio para robôs
Modelo 'embodied reasoning' da DeepMind permite vídeo contínuo, chamadas de ferramentas e cooperação multi-robô; já está disponível via Gemini API.
O que aconteceu
A Google DeepMind lançou o Gemini Robotics ER 2, descrito como o modelo de “raciocínio incorporado” (embodied reasoning) mais capaz da empresa para robótica (fonte: blog oficial da DeepMind). O modelo funciona como um “cérebro de alto nível” para robôs: entende o ambiente físico, conversa com humanos, planeja tarefas de múltiplas etapas e repassa a execução motora para um modelo de visão-linguagem-ação (VLA) de nível inferior. O ER 2 também pode chamar nativamente ferramentas como Google Search ou funções definidas pelo usuário.
O anúncio confirma uma melhora significativa sobre a versão anterior (ER 1.6). Com feeds de vídeo contínuos, os robôs agora conseguem rastrear o próprio progresso, adaptar-se quando algo dá errado e decidir o momento exato de passar para a próxima etapa. Outra novidade é a colaboração multi-robô: múltiplas máquinas podem atuar em um mesmo espaço para concluir fluxos de trabalho que um único robô não daria conta.
O Gemini Robotics ER 2 já está disponível publicamente para desenvolvedores via Gemini API e Google AI Studio, além de acesso em preview privado na plataforma Gemini Enterprise Agent Platform. A DeepMind publicou exemplos de configuração e prompts para ajudar a usar o modelo em aplicações de IA física.
Contexto
O anúncio chega nove meses após o lançamento do Gemini Robotics ER 1.6, que já permitia raciocínio espacial básico. A nova versão ataca a lacuna entre raciocínio estático e execução física em tempo real: segundo a DeepMind, robôs em ambientes domésticos e industriais precisam não só entender posições, mas responder na velocidade do mundo real. O ER 2 foi projetado para permitir que o robô “pense” no próximo passo enquanto executa ações simultaneamente, algo que a empresa considera essencial para tarefas dinâmicas.
A DeepMind também destaca a evolução na orquestração de ferramentas: desenvolvedores podem declarar interfaces de controle de baixo nível, como VLAs ou APIs de navegação, como ferramentas, e o modelo integra essas chamadas ao fluxo de raciocínio.
Por que importa
Para o mercado brasileiro, o lançamento abre caminho para automação mais flexível em setores como logística, manufatura e agricultura — áreas em que a colaboração entre robôs e a capacidade de se adaptar a imprevistos são críticas. O fato de o modelo ser acessível via API pública reduz a barreira para startups e empresas de tecnologia locais que já usam o ecossistema Google, permitindo testar protótipos sem investir em infraestrutura própria de IA.
Além disso, a integração nativa com ferramentas como Google Search significa que robôs poderão buscar informações externas para completar tarefas — por exemplo, consultar um manual de instruções ou verificar estoque em tempo real.
Impacto
No curto prazo, a novidade deve acelerar o desenvolvimento de sistemas robóticos comerciais que exigem raciocínio de alto nível, como assistentes em armazéns ou robôs domésticos. A capacidade de trabalhar em equipe (multi-robot collaboration) tende a reduzir custos de implementação, pois várias máquinas podem dividir tarefas complexas sem necessidade de coordenação central dedicada.
No médio prazo, o ER 2 pode pressionar concorrentes como OpenAI e Meta, que também investem em modelos de robótica. O diferencial da Google está na integração com a infraestrutura de nuvem e na base instalada de desenvolvedores da Gemini API.
O que muda
A principal mudança é a passagem de robôs reativos para robôs agentes. Em vez de seguir comandos pré-programados, o sistema orquestra etapas, corrige erros e decide quando avançar — com base em fluxos contínuos de vídeo. Para desenvolvedores, a interface declarativa de ferramentas simplifica a integração com VLAs e APIs já existentes, reduzindo o tempo de desenvolvimento.
Outra mudança relevante é a avaliação do modelo: a DeepMind informa que o ER 2 supera consistentemente o ER 1.6 em orquestração de ferramentas em três modos de controle — VLA real, VLA simulado e teleoperação humana.
O que vem agora
A DeepMind prometeu mais detalhes e exemplos de código para desenvolvedores, além de expansão do preview na Gemini Enterprise Agent Platform. No Brasil, a expectativa é que universidades e centros de pesquisa usem a API para testar robótica educacional e industrial. Não há data confirmada para um modelo ainda mais avançado, mas o próprio anúncio sugere que a empresa tratará o vídeo contínuo e a colaboração multi-robô como espinha dorsal das próximas versões.
