Iris: agentes de busca open-source batem recordes em benchmarks de pesquisa na web

Paper no arXiv detalha pipeline de dados e o método SFT-RL climbing por trás dos dois modelos

Por Marcos Guimarães7 set 2026
Iris: agentes de busca open-source batem recordes em benchmarks de pesquisa na web

O que aconteceu

Um grupo de pesquisadores apresentou no arXiv, em 3 de setembro de 2026, o paper "Iris: Climbing to the Search Frontier" (arXiv:2609.04304). O trabalho descreve dois agentes de busca, Iris-mini e Iris-pro, treinados nas escalas 35B-A3B e 397B-A17B, ou seja, 35 bilhões de parâmetros totais com 3 bilhões ativos no mini e 397 bilhões totais com 17 bilhões ativos no pro.

Os números são fortes. Com gerenciamento de contexto habilitado, Iris-mini atingiu 82,2 no BrowseComp, 84,8 no BrowseComp-ZH, 86,9 no DeepSearchQA e 52,3 no HLE. Iris-pro, o modelo maior, alcançou 88,6 no BrowseComp, 85,1 no BrowseComp-ZH, 92,9 no DeepSearchQA e 56,4 no HLE. Segundo o paper, esses são os melhores resultados gerais entre agentes de busca open-source em suas respectivas faixas de parâmetros.

Os autores do Iris planejam liberar os pesos dos modelos junto com a receita completa de construção de dados, treinamento e avaliação.

Contexto

A construção dos dados de treinamento é o ponto mais interessante do trabalho. As tarefas são construídas de forma reversa a partir da estrutura de hyperlinks de um corpus da web. Os pesquisadores criam cadeias multi-hop sobre um grafo de entidades destilado de uma página semente e seus links de saída.

O detalhe que separa o Iris de trabalhos anteriores: cada entidade que não é a resposta é reescrita como uma referência descritiva. Assim, nenhuma pista pode ser resolvida por simples correspondência de strings. Só entram no conjunto perguntas que um modelo de referência erra sem consulta (closed-book) mas acerta quando a evidência de suporte é fornecida.

O treinamento alterna duas etapas. Primeiro, as perguntas viram trajetórias filtradas nos níveis de trajetória e de turno antes do SFT (supervised fine-tuning). Depois, a política é otimizada por RL (reinforcement learning) contra busca ao vivo, com o juiz de recompensa e o resumidor de observações rodando dentro do próprio cluster de treinamento. Rollouts muito longos são interrompidos no nível de requisição e retomados do prefixo já confirmado no passo seguinte.

A alternância das duas etapas recebeu o nome de SFT-RL climbing: os rollouts mais difíceis resolvidos e mais eficientes de cada rodada de RL retornam para a próxima passada supervisionada.

Por que importa

O paper faz uma advertência que muda a leitura de benchmarks do setor. Segundo os autores, o gerenciamento de contexto em tempo de inferência vale mais nesses benchmarks do que a maioria das diferenças reportadas entre sistemas. Por isso, o Iris foi avaliado com e sem esse gerenciamento, mantendo fixos o conjunto de ferramentas, o limite de contexto e o juiz.

Outro ponto relevante: todos os resultados vêm de um único agente ReAct, sem sub-agentes e sem verificação em tempo de teste. Isso significa que o desempenho não depende de orquestração complexa de múltiplos modelos, uma arquitetura mais barata de rodar e mais fácil de replicar.

Impacto

Se os pesos e a receita completa forem realmente liberados, equipes que hoje dependem de APIs fechadas para busca profunda na web ganham uma alternativa open-source com desempenho de ponta. O Iris-mini, com apenas 3 bilhões de parâmetros ativos, é o candidato natural para rodar em infraestrutura modesta. O Iris-pro, com 17 bilhões ativos, mira os casos mais difíceis.

A transparência sobre o método de avaliação, com e sem gerenciamento de contexto, também pressiona outros laboratórios a reportar números nas mesmas condições, o que facilita comparações honestas entre sistemas.

O que muda

Para o mercado de agentes de busca, o Iris-mini e o Iris-pro estabelecem um novo piso de desempenho open-source nas faixas de 35B-A3B e 397B-A17B. O método SFT-RL climbing, que recicla os rollouts mais difíceis de cada rodada de RL para o próximo estágio supervisionado, pode ser adotado por outros grupos assim que a receita completa for publicada.

O que vem agora

O próximo passo anunciado pelos autores é a liberação dos pesos dos dois modelos junto com o pipeline completo de construção de dados, treinamento e avaliação. O paper não traz data específica para o release. Até lá, os números do arXiv servem como referência, mas a verificação independente pela comunidade só será possível quando os modelos estiverem disponíveis.