ARC-Bench expõe falha de ranking em world models JEPA congelados

Protocolo mede a premissa central dos planejadores de espaço latente e encontra inversão de ranking em navegação e manipulação

Por Marcos Guimarães10 set 2026
ARC-Bench expõe falha de ranking em world models JEPA congelados

O que aconteceu

O ARC-Bench, protocolo de avaliação apresentado no artigo arXiv:2609.05461, auditou diretamente uma premissa que quase nunca é testada. World models latentes sem recompensa planejam pontuando ações candidatas pela distância no espaço latente. Uma ação é preferida se o embedding futuro previsto cair mais perto do embedding do objetivo. Isso pressupõe, sem dizer em voz alta, que a proximidade latente é ordenável por ação, ou seja, que ordenar candidatos por distância latente concorda com ordená-los pelo custo real.

O ARC-Bench, protocolo sem vazamento e com candidatos fixos, foi construído para medir exatamente isso. Os autores aplicaram o protocolo a checkpoints oficiais já liberados de JEPA-WM, os world models da família JEPA, em tarefas de navegação e de controle no estilo manipulação. O resultado é severo. Nas auditorias oficiais de manipulação, o candidato com melhor pontuação é quase sempre subótimo. A mesma inversão de ranking aparece nos domínios de labirinto.

Contexto

A família JEPA ficou conhecida por aprender representações latentes sem depender de recompensa. O planejamento, nesse desenho, vira uma operação de comparação de distâncias. O modelo prevê o futuro no espaço latente, compara com o objetivo e escolhe o candidato mais próximo. A hipótese de que essa ordenação funciona é o alicerce silencioso do método.

Os autores testaram se a falha vinha de algum detalhe trivial. Fizeram uma extensão controlada de backbone visual, trocando o DINOv2 por encoders pré-treinados em vídeo, o V-JEPA 1 e o V-JEPA 2, em escalas ViT-L e ViT-G. O defeito persistiu. O JEPA-WM, com seus checkpoints oficiais, continuou errando o ranking mesmo com encoders maiores e treinados em vídeo. Controles de proveniência, de subtreinamento, de orçamento igualado entre backbones e de circularidade de métrica descartaram explicações simples. O problema, segundo o artigo, é estrutural, não um acidente de treino.

Por que importa

O artigo explica por que esse defeito passou tanto tempo invisível. O replanejamento em ciclo fechado o mascara. Quando os pesquisadores reduziram a frequência de replanejamento do planejador, o sucesso desabou tanto em um domínio de navegação quanto em um de manipulação. Os episódios que o replanejamento frequente salvava estavam enriquecidos de falhas severas de ranking no primeiro plano, o que o diagnóstico de primeiro plano do PointMaze deixou explícito.

A consequência é direta para quem lê números de benchmark. Taxas de sucesso em ciclo fechado superestimam de forma sistemática a capacidade de ordenação das representações latentes congeladas. O JEPA-WM, que parece funcionar, funciona porque replaneja muitas vezes e corrige o erro no caminho. O ARC-Bench fornece a medição que faltava. O mecanismo de mascaramento fornece a explicação que faltava.

Impacto

O alvo do recado são os métodos que adaptam, amortizam ou replanejam em torno de planejadores de espaço latente sem auditar a ordenação de ações dos JEPA-WM liberados. Times de robótica que usam checkpoints públicos para planejar manipulação podem estar apoiados em rankings invertidos e compensando com replanejamento caro. Laboratórios que reportam sucesso em navegação precisam agora olhar a frequência de replanejamento usada na avaliação, porque ela muda o resultado.

O mesmo vale para quem compara arquiteturas. Trocar o DINOv2 pelo V-JEPA 2 em escala ViT-G não resolve a inversão, segundo os controles do artigo. Aumentar o encoder não conserta a ordenação. Isso desloca o debate de escala para o de objetivo de treino.

O que muda

A avaliação de world models latentes ganha um protocolo específico para medir ordenação de ações, em vez de inferi-la a partir de sucesso em ciclo fechado. O ARC-Bench mede se objetivos no estilo JEPA congelados ordenam candidatos corretamente. O replanejamento em ciclo fechado deixa de ser evidência suficiente de qualidade de representação.

Na prática, relatar sucesso sem informar a frequência de replanejamento passa a ser um número incompleto. O diagnóstico de primeiro plano do PointMaze mostra o caminho: olhar o plano inicial, antes de qualquer correção, revela a falha que o ciclo fechado esconde.

O que vem agora

O artigo está disponível no arXiv, com o identificador arXiv:2609.05461, submetido em 12 de agosto de 2026. O ARC-Bench e o mecanismo de mascaramento por replanejamento são as duas contribuições centrais apresentadas pelos autores. O próximo passo natural é a adoção do protocolo por quem publica checkpoints de JEPA-WM e por quem constrói métodos que amortizam ou adaptam planejadores latentes. Sem essa auditoria, os números de sucesso continuam contando uma história mais otimista do que a representação congelada sustenta.

Fontes

  • arXiv cs.AI: ARC-Bench: Closed-Loop Replanning Masks Broken Action Ranking in Frozen JEPA World Models (https://arxiv.org/abs/2609.05461)