OdoBot corta até 80% dos tokens em agentes web, diz arXiv

Nova arquitetura cria um modelo de comportamento da aplicação a partir de demonstrações e reduz o custo de execução de tarefas

Por Marcos Guimarães15 set 2026
OdoBot corta até 80% dos tokens em agentes web, diz arXiv

O que aconteceu

O artigo "Token Efficient Task Execution via Application Behavior Modeling for Web Agents" foi submetido ao arXiv em 11 de setembro de 2026 e publicado sob o identificador arXiv:2609.13491v1, com primeira visualização registrada em 15 de setembro de 2026. O trabalho apresenta o OdoBot, uma arquitetura de agente web que conclui tarefas a uma fração do custo de agentes web convencionais.

O OdoBot, agente web proposto no artigo, usa 44% e 80% menos tokens do que dois concorrentes de ponta, Agent-E e WebVoyager. O resumo do paper lista os dois percentuais ao lado dos dois agentes, mas não detalha qual número corresponde a cada concorrente. Os experimentos cobriram 45 tarefas no Canvas Learning Management System (LMS), ambiente usado como base de teste.

Além da economia de tokens, o OdoBot superou o WebVoyager na taxa de sucesso das tarefas. O agente OdoBot, segundo os autores, alcança esse resultado porque se apoia em um modelo de comportamento da aplicação, construído a partir da análise de demonstrações de execução bem-sucedidas.

Contexto

O ponto de partida do artigo é econômico. Os autores afirmam que o bom desempenho de agentes de IA em uma variedade ampla de tarefas está impulsionando um investimento sem precedentes em infraestruturas para agentes, mas o custo de processamento de tokens cresce rápido. É essa conta que o trabalho tenta atacar.

Agentes web automatizam a execução de tarefas de aplicações descritas em linguagem natural analisando a interface de usuário (UI) do sistema e interagindo com ela. Esse método, que domina a geração atual de agentes, exige que o modelo leia e reprocesse partes da tela a cada passo. Quanto mais complexa a aplicação, mais tokens queimados por tarefa.

O caminho do OdoBot é diferente. Em vez de explorar a interface do zero em cada ação, o agente usa um modelo de comportamento da aplicação aprendido com demonstrações de tarefas concluídas com sucesso. O modelo de comportamento da aplicação funciona como um mapa prévio do que costuma acontecer naquele sistema, o que reduz a necessidade de reavaliar a UI a todo momento.

Por que importa

Token é dinheiro. Cada chamada de um agente web a um modelo de linguagem custa por volume de texto processado, e tarefas longas em sistemas corporativos podem envolver dezenas de passos. Uma redução de 44% ou de 80% no consumo de tokens se traduz diretamente em custo por tarefa, e é isso que define se um agente sai do protótipo e entra na operação.

O Canvas LMS, escolhido para os experimentos, é um sistema real de gestão de aprendizagem usado por instituições de ensino, com fluxos como matrícula, consulta de notas e envio de atividades. Testar em um ambiente desse tipo, e não em páginas sintéticas de laboratório, aproxima o resultado do que uma empresa enfrentaria ao automatizar processos internos.

Quem ganha são as equipes que já rodam agentes em escala e sentem a fatura de tokens subir mês a mês. Quem perde, no curto prazo, são as abordagens que dependem de varredura contínua da interface como única estratégia. O OdoBot aponta que existe espaço para eficiência antes de o problema virar custo proibitivo.

Impacto

O impacto mais imediato é a mudança de métrica. Durante a fase de entusiasmo com agentes, a taxa de sucesso em tarefas foi o número que dominou as comparações. O artigo coloca tokens por tarefa ao lado da taxa de sucesso, e o OdoBot vence o WebVoyager nos dois critérios, o que obriga qualquer avaliação futura de agentes web a reportar custo junto com acerto.

Para produtos construídos sobre aplicações estáveis, com fluxos que se repetem, a abordagem do OdoBot tende a ser mais vantajosa, porque o modelo de comportamento rende mais quanto mais previsível for o sistema. Em aplicações que mudam de layout toda semana, o ganho tende a encolher, já que o modelo aprendido precisa ser reconstruído.

O que muda

A mudança central é o deslocamento do esforço. O agente deixa de gastar tokens interpretando a interface a cada passo e passa a gastar trabalho na construção de um modelo de comportamento da aplicação, alimentado por demonstrações de execução bem-sucedidas. O OdoBot transforma execução repetida em conhecimento reutilizável.

Isso também muda a forma de treinar e manter agentes web. Em vez de ajustar prompts e heurísticas de leitura de tela, as equipes passam a coletar demonstrações de tarefas que deram certo e a destilar esse histórico em um modelo da aplicação. A economia de tokens no OdoBot é consequência direta desse processo.

O que vem agora

O artigo é um preprint depositado no arXiv e ainda não passou por revisão por pares, o que significa que os números do OdoBot precisam ser reproduzidos por outros grupos antes de virarem consenso. Os próprios experimentos se limitam ao Canvas Learning Management System (LMS), com 45 tarefas, um recorte pequeno diante da variedade de aplicações web existentes.

O passo natural é testar o OdoBot em outros sistemas, medir o custo de construir o modelo de comportamento e verificar como ele se comporta quando a aplicação muda. Enquanto isso, o dado que fica é o do resumo: 44% e 80% menos tokens do que Agent-E e WebVoyager, com vantagem também na taxa de sucesso sobre o WebVoyager.

Fontes