Apodex Discovery propõe novo padrão para avaliar IA de descoberta
Framework testa modelos em problemas reais e verificáveis, não em benchmarks fixos
Pesquisadores apresentaram no arXiv, em 11 de agosto de 2026, o Apodex Discovery, um framework para construir e avaliar sistemas de IA dedicados à descoberta científica. O paper (arXiv:2608.11341, categoria cs.AI) descreve o "heavy-duty solver", um sistema que combina modelo fundacional, harness, ferramentas e políticas de controle para conduzir investigações longas, com estado e verificáveis.
O que aconteceu
O Apodex Discovery tem três componentes centrais. O primeiro é um processo de prospecção de problemas: 561 indústrias em 16 setores foram levantadas, resultando em 423 problemas reais de alto valor, dos quais 20 foram selecionados para a versão inicial. O segundo é a abstração comum de ambiente-tarefa-episódio, chamada TRACES, que reúne dados, ferramentas, restrições, feedback, registro de trajetória e verificação de artefatos intermediários e da submissão final. O terceiro é o sistema de avaliação HDS6, que mede uso de ferramentas (Tools), correção de rota (Repair), alternativas (Alternatives), coerência (Coherence), evidência (Evidence) e escopo (Scope), independentemente do sucesso final da tarefa (arXiv).
Contexto
A motivação declarada é a comparação com o programa Apollo: a chegada à Lua não veio apenas da capacidade de resolver equações difíceis, mas da transformação de uma ambição distante em uma arquitetura de missão com objetivos explícitos, simulação, verificação e correção repetida. Os autores argumentam que modelos de fronteira resolvem tarefas difíceis quando o problema, as ferramentas e os critérios de sucesso já estão especificados, mas que desafios reais raramente chegam prontos para execução ou verificação. A crítica de fundo é aos benchmarks fixos, que avaliam modelos em problemas fechados e ignoram o processo de investigação.
Por que importa
Os resultados iniciais mostram ganho mensurável. Em design de capsídeos AAV, usados como vetores em terapia gênica, o Apodex superou o estado da arte publicado em 7% em viabilidade, tropismo, predição de estrutura e design generativo. Em reposicionamento e reformulação de fármacos, um ambiente biomédico específico elevou a pontuação normalizada média de predição do GPT-5.5 em 2,5 pontos e do GPT-5.6-sol em 7,6 pontos, na comparação com o mesmo modelo sem o framework (arXiv). Para laboratórios e empresas farmacêuticas, isso aponta um caminho para usar IA em problemas abertos, sem resposta predefinida.
Impacto
No curto prazo, a proposta desloca o eixo da avaliação de IA: em vez de comparar modelos em tarefas prontas, mede-se a capacidade de conduzir investigações verificáveis. As ablações controladas indicam que a interface fixa de episódios TRACES permite atribuir diferenças de desempenho a componentes específicos do solver, o que ajuda a identificar o que de fato melhora os resultados. No médio prazo, a avaliação por investigação pode se tornar referência em áreas como descoberta de medicamentos e design de moléculas.
O que muda
Para quem desenvolve ou contrata sistemas de IA, o parâmetro deixa de ser apenas acertar ou errar a tarefa e passa a incluir o percurso: uso de ferramentas, correção de rota, evidência produzida e coerência. O HDS6 foi desenhado para funcionar mesmo quando o resultado final não é perfeito, o que se aproxima mais do trabalho real de cientistas e engenheiros.
O que vem agora
Os autores não divulgam calendário público, mas a arquitetura indica os próximos passos: ampliar os 20 problemas iniciais para os 423 mapeados e aplicar o HDS6 a domínios além da biomedicina. O artigo está disponível na categoria cs.AI do arXiv, com as ferramentas associadas de código e dados da própria plataforma.
Fontes
- arXiv cs.AI — "Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence" (arXiv:2608.11341) — https://arxiv.org/abs/2608.11341
