ContractScrub: Novo benchmark para revisão de contratos com IA
Pesquisa revela que modelos de IA mais avançados ainda têm dificuldades em tarefas de revisão contratual detalhada.
O que aconteceu
Em 20 de agosto de 2026, pesquisadores publicaram no arXiv o ContractScrub, o primeiro benchmark projetado para avaliar a capacidade de LLMs em fazer a revisão final de contratos legais, conhecida como 'scrubbing'. O benchmark é composto por contratos elaborados por advogados experientes, abrangendo categorias de erros como uso incorreto de termos definidos, referências incorretas e linguagem inconsistente. Os resultados mostraram que os modelos de IA de ponta tiveram um desempenho surpreendentemente baixo: apenas um modelo alcançou um recall médio macro de 0,75, apesar de terem bom desempenho em benchmarks gerais relacionados (arXiv).
Contexto
O trabalho jurídico, com sua forte dependência de processar grandes quantidades de texto, é frequentemente considerado um dos domínios mais expostos ao uso de LLMs. A revisão de contratos, ou 'scrubbing', é uma tarefa rotineira e minuciosa que requer atenção detalhada a documentos longos, alinhando-se naturalmente com as capacidades gerais esperadas de LLMs de ponta, como raciocínio de longo contexto, verificação de consistência e reconhecimento de entidades nomeadas (NER). Apesar do valor econômico e do potencial para automação, não havia avaliações formais anteriores de LLMs realizando essa tarefa específica (arXiv).
Por que importa
A publicação do ContractScrub destaca a importância de benchmarks específicos de domínio para medir o impacto real da IA no mundo jurídico. Para empresas de tecnologia legal, advogados e desenvolvedores de IA, o estudo revela os limites práticos dos modelos atuais, mostrando que capacidades gerais nem sempre se traduzem em desempenho em tarefas especializadas. Isso pode influenciar decisões sobre investimentos em automação jurídica e direcionar pesquisas para modelos mais focados, oferecendo um panorama mais realista das aplicações de IA.
Impacto
No curto prazo, o estudo pode desacelerar a adoção acrítica de ferramentas de IA para revisão contratual, levando as empresas a buscarem validações mais rigorosas e benchmarks de domínio. A médio prazo, espera-se um aumento no desenvolvimento de benchmarks e modelos treinados especificamente para tarefas jurídicas, visando melhorar a precisão e confiabilidade. Para o mercado brasileiro, onde a automação jurídica está em crescimento, isso reforça a necessidade de soluções adaptadas ao contexto local, evitando generalizações apressadas.
O que muda
O ContractScrub introduz um novo padrão para avaliar IA em contextos jurídicos, mudando o foco de benchmarks genéricos para testes específicos de domínio. Isso pode acelerar a criação de ferramentas mais confiáveis para advogados e empresas, reduzindo riscos em contratos. Também abre caminho para pesquisas que priorizem a precisão em tarefas reais, em vez de métricas abstratas.
O que vem agora
Os próximos passos incluem a expansão do benchmark para mais categorias de erros e tipos de contratos, além de pesquisas para melhorar o desempenho dos modelos de IA em tarefas de revisão. A comunidade de IA e direito provavelmente desenvolverá mais benchmarks específicos, promovendo uma avaliação mais precisa da utilidade prática da tecnologia. Também pode haver um foco maior em treinar modelos com dados jurídicos de alta qualidade para superar as limitações atuais.
Fontes
- arXiv cs.AI | RESEARCH | ContractScrub: A benchmark for final review of legal contracts (https://arxiv.org/abs/2608.20204)
