DECOWAM: modelo de IA separa movimentos de corpo e braços em robôs móveis

Pesquisa publicada no arXiv apresenta world-action model que distingue locomoção de movimentos de braços

Por Marcos Guimarães21 ago 2026
DECOWAM: modelo de IA separa movimentos de corpo e braços em robôs móveis

O que aconteceu

O artigo "DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation" foi publicado no arXiv em 20 de agosto de 2026. O modelo constrói sobre o backbone do FastWAM, congelando-o e treinando adaptadores residuais para separar a influência da locomoção e dos braços por meio de interfaces condicionais dedicadas.

Em 79 ensaios fechados por método, o DECOWAM apresentou a maior coordenação corpo-inteiro e robustez de deslocamento da base entre os sistemas comparados. O erro quadrático médio (MSE) de previsão de ação caiu 21,7%, com 25,95M de parâmetros treináveis. A conclusão das tarefas ficou comparável ao melhor baseline.

O trabalho também introduziu o ARMDOG, um dataset real de robô que sincroniza vídeo, estado corpo-inteiro, ação e linguagem.

Contexto

Modelos de world-action existentes foram desenvolvidos principalmente para plataformas de base fixa. Eles não distinguem explicitamente o ego-motion da câmera das ações do base e dos braços. Em robôs móveis com pernas, a locomoção e o movimento dos braços alteram conjuntamente as observações futuras e o controle — o que torna a integração de visão e locomoção mais difícil do que em robôs parados.

Por que importa

O DECOWAM endereça esse problema por meio de latentes de base e braços adversarialmente separados, condicionamento por velocidade da base para previsão de vídeo, e um bottleneck futuro equivalente a ação destilado de observações privilegiadas. O foco em eficiência de parâmetros torna o modelo viável para implementação em hardware real, sem necessidade de retreinar modelos de grande porte do zero.

Impacto

Nos ensaios, o DECOWAM atingiu a maior coordenação corpo-inteiro e robustez de deslocamento da base entre os comparados, embora a conclusão da tarefa tenha ficado equivalente ao melhor baseline. A factorização consciente de embodiment permite previsão visual e controle corpo-inteiro sob pontos de vista em movimento com menor custo computacional.

O que muda

A distinção entre movimentos de corpo e braços em modelos de world-action abre caminho para robôs móveis mais precisos em ambientes dinômicos. Para pesquisadores em robótica, o approach oferece uma alternativa eficiente em parâmetros ao retreinamento completo de modelos existentes.

O que vem agora

O dataset ARMDOG pode servir como base para futuros trabalhos de modelagem world-action para mobile manipulation. A generalização do modelo para outros tipos de robôs e tarefas de manipulação é um dos caminhos possíveis para pesquisas subsequentes.