RegDivergence-101: benchmark de IA para conflitos entre FDA e EMA
Estudo no arXiv lança benchmark com 101 pares de exigências regulatórias dos EUA e da UE; Claude Haiku lidera baseline
O que aconteceu
O RegDivergence-101: An LLM Benchmark for Cross-Jurisdiction Regulatory Contradiction Detection in Life Sciences foi submetido ao arXiv em 8 de julho de 2026, na categoria Computer Science > Artificial Intelligence (arXiv:2608.28607v1). O estudo introduz a tarefa de detecção de divergência regulatória entre jurisdições: dado um requisito da FDA e um requisito da EMA sobre o mesmo tópico, o modelo deve classificar a relação como AGREE, DIVERGE ou SILENT. A classe SILENT é direcional, registrada como SILENT_FDA ou SILENT_EMA, e a avaliação reporta F1 por direção além do rótulo colapsado. O benchmark RegDivergence-101 reúne 101 pares de requisitos com rótulos fundamentados em três estudos comparativos revisados por pares e em textos de orientação da FDA, da EMA e da ICH. A anotação dupla alcançou kappa de 0,85 entre anotadores.
A linha de base avaliou quatro métodos: heurística lexical (0,511 de macro-F1, IC 95% [0,411-0,605]), NLI cross-encoder (0,233), Graph-RAG em nível de obrigação (0,663 [0,570-0,747]) e um LLM flat como juiz, o Claude Haiku, com 0,830 [0,747-0,908].
Contexto
O problema nasce da prática regulatória. Uma farmacêutica que desenvolve um medicamento para os Estados Unidos e para a União Europeia precisa conciliar orientações emitidas de forma independente pela FDA e pela EMA. Quando as duas agências exigem substancialmente a mesma coisa, o patrocinador pode protocolar uma única documentação. Quando os requisitos divergem, um mesmo desenho de ensaio clínico corre o risco de ser rejeitado em uma das regiões. Quando uma agência é silenciosa sobre um ponto que a outra regula, o patrocinador precisa inferir quais obrigações existem. Hoje essa conciliação é feita manualmente por especialistas em assuntos regulatórios. O custo e o tempo desse trabalho motivaram a criação do benchmark.
Por que importa
Para a indústria farmacêutica, o impacto é direto. Um desenho de ensaio clínico que atende à exigência de uma agência, mas diverge da outra, pode ser rejeitado em uma das regiões, o que obriga a um novo protocolo e atrasa o cronograma. A detecção automática de divergências permite que a equipe regulatória priorize os pontos de atenção antes do envio da documentação. O benchmark também serve como teste objetivo para empresas que querem adotar IA em compliance. Os números mostram a dificuldade: o método baseado em entailment (NLI cross-encoder) ficou em 0,233, o pior da linha de base. Isso indica que a relação de implicação textual não captura o silêncio regulatório. O melhor resultado, 0,830, ainda deixa cerca de 17% de erro, o que mostra que a tarefa não está resolvida.
Impacto
O estudo traz três observações direcionais. A primeira: a classe SILENT é semanticamente detectável, mas invisível para formulações baseadas apenas em entailment. Um sistema que só pergunta se uma frase implica a outra não consegue identificar quando uma agência não disse nada sobre um ponto que a outra regula. A segunda: os grafos de obrigação em nível de par melhoram o resultado em relação aos métodos lexicais (0,663 contra 0,511), mas ficam atrás do LLM flat (0,830), com intervalos de confiança parcialmente sobrepostos. A terceira: a construção de grafos em nível de corpus é o alvo arquitetural indicado para a detecção de silêncio em larga escala. No curto prazo, o RegDivergence-101 dá aos pesquisadores uma referência comum para comparar abordagens. No médio prazo, se o benchmark crescer, ele pode se tornar um padrão para avaliar ferramentas de IA regulatória. A liberação é descrita como piloto, com quatro domínios regulatórios ainda não representados.
O que muda
Laboratórios de regulatory affairs ganham uma forma de medir a capacidade de um modelo antes de colocá-lo em produção. Em vez de depender de avaliações subjetivas, eles podem rodar o mesmo conjunto de 101 pares e comparar o F1. O benchmark também muda a conversa sobre IA e direito regulatório: há uma métrica concreta para o problema específico de reconciliação entre FDA e EMA. Para provedores de modelos, o resultado do Claude Haiku serve como ponto de referência. Modelos maiores ou especializados precisarão superar 0,830 para justificar adoção. Para times de compliance, a lição é que a abordagem de grafos, embora promissora, ainda não supera um LLM com contexto plano, e que o silêncio regulatório exige técnicas específicas.
O que vem agora
Os autores do artigo descrevem na Seção 7 um roadmap de expansão com quatro domínios regulatórios não representados no conjunto atual. Também indicam que a construção de grafos em nível de corpus é o caminho arquitetural para a detecção de silêncio em larga escala. Não há datas divulgadas no material para esses próximos passos. O benchmark permanece como versão piloto para estabelecer a formulação da tarefa e a hierarquia de baselines.
Fontes
arXiv (https://arxiv.org/abs/2608.28607)
