ViperQ: IA de trading com Auction Market Theory rende +163,6%
Sistema de reinforcement learning usa primitivas da Auction Market Theory e recompensa assimétrica baseada em aversão à perda
O que aconteceu
O artigo ViperQ: Order Flow Pattern Recognition via Auction Market Theory for Reinforcement Learning Trading foi submetido ao arXiv em 12 de setembro de 2026 e catalogado como arXiv:2609.13825v1, na área de Inteligência Artificial (cs.AI). O ViperQ é um sistema de reinforcement learning cuja representação de estado é montada a partir de primitivas da Auction Market Theory: Volume Point of Control, posição da Value Area, sinalizadores de Low Volume Node, divergência de Cumulative Volume Delta e assinaturas de tape velocity.
A representação de estado do ViperQ, sistema de reinforcement learning, é um vetor de 20 dimensões normalizado por Z-score, montado com essas primitivas da Auction Market Theory. O ViperQ roda com dois agentes treinados por Proximal Policy Optimisation (PPO). Os dois agentes PPO do ViperQ foram treinados com uma função de recompensa assimétrica ancorada em teoria da perspectiva, que penaliza posições perdedoras em magnitude consistente com o coeficiente de aversão à perda de Kahneman e Tversky.
O ViperQ alcançou +163,6% de ROI em TSLA, com drawdown máximo de -27,5% e 27.019 operações, e +116,5% de ROI em NVDA, com drawdown máximo de -47,8% e 12.892 operações, tudo sem alavancagem. Os resultados do ViperQ em TSLA e NVDA vieram de uma partição de doze meses de dados tick institucionais que os agentes nunca viram, reservada especificamente para o teste.
Contexto
O ponto de partida do artigo é uma lacuna da literatura acadêmica. Sistemas de reinforcement learning para trading publicados em periódicos revisados se apoiam quase sempre em representações de estado agregadas por preço, as barras OHLCV (abertura, máxima, mínima, fechamento e volume), ou em atributos de profundidade do livro de ofertas (limit order book).
As teorias de microestrutura vindas do meio profissional, em especial a Auction Market Theory e o Market Profile, nunca tinham recebido uma instanciação computacional revisada por pares. O ViperQ é apresentado como essa instanciação. A proposta é trocar o insumo de entrada: em vez de entregar ao agente apenas preço agregado, o artigo entrega a ele a leitura de leilão do mercado, com ponto de controle de volume, área de valor e nós de baixo volume convertidos em números.
Por que importa
A diferença prática está no que o agente enxerga. Barras OHLCV resumem horas ou minutos em cinco números e apagam o caminho percorrido pelo preço dentro do período. As primitivas da Auction Market Theory preservam onde o volume se concentrou, onde faltou liquidez e se o fluxo agressor está divergindo do preço.
O segundo ponto é a função de recompensa. Em vez de maximizar retorno puro, o ViperQ pune posições perdedoras com magnitude calibrada pelo coeficiente de aversão à perda de Kahneman e Tversky. É uma tentativa de transferir para a máquina um comportamento que a literatura de finanças comportamentais atribui a humanos.
Impacto
Os números chamam atenção tanto pelo retorno quanto pelo risco. O drawdown máximo de -47,8% em NVDA e de -27,5% em TSLA mostra que a estratégia do ViperQ não é de baixa volatilidade. Em NVDA, o sistema quase perdeu metade do capital em algum momento do período avaliado, mesmo terminando com +116,5% de ROI.
O volume de operações também é relevante. O ViperQ executou 27.019 negócios em TSLA e 12.892 em NVDA no intervalo de doze meses. Com essa frequência, custos de corretagem e slippage passam a pesar no resultado final, e o resumo do artigo não informa se esses custos foram descontados.
Para quem pesquisa aprendizado por reforço aplicado a séries financeiras, o recado é que a escolha da representação de estado pode valer mais do que a escolha do algoritmo. O ViperQ usa PPO, um método já conhecido e amplamente disponível, e concentra a novidade no insumo e na recompensa.
O que muda
O artigo estabelece as features da Auction Market Theory como uma modalidade de entrada estruturada e tratável para decisão sequencial em séries temporais financeiras. Na prática, isso abre uma linha de trabalho: se primitivas de microestrutura funcionam como estado, outros conjuntos de features vindos da prática de mesa podem ser testados do mesmo jeito.
O ViperQ também desloca o debate sobre reward shaping. A função de recompensa assimétrica, inspirada em prospect theory, vira uma peça tão central quanto a arquitetura do agente. O texto motiva trabalho adicional em aprendizado de política ciente de microestrutura.
O que vem agora
O artigo é um preprint no arXiv e ainda não passou por revisão por pares, etapa que o próprio texto cobra da literatura que critica. Não há menção no material a código aberto, conjunto de dados público ou replicação independente.
Os próximos passos apontados são o aprofundamento em policy learning ciente de microestrutura e a extensão do uso de features de Auction Market Theory em outros ativos e horizontes. Até lá, os +163,6% de ROI em TSLA e os +116,5% em NVDA do ViperQ seguem como resultado de um único estudo, em dados históricos, com os drawdowns expressivos que o próprio resumo reporta.
FONTES
- arXiv cs.AI: ViperQ: Order Flow Pattern Recognition via Auction Market Theory for Reinforcement Learning Trading (arXiv:2609.13825v1) https://arxiv.org/abs/2609.13825
