Nvidia mostra que o harness, não o modelo de IA, é o verdadeiro herói
Pesquisa da Nvidia indica que o sistema de controle, não o modelo, define o sucesso em tarefas de longo prazo.
O que aconteceu
A Nvidia divulgou na sexta-feira (21) uma pesquisa que desafia a visão comum sobre sistemas de IA agênticos. Os pesquisadores da empresa demonstraram que, ao usar um harness personalizado com gerenciamento de memória eficiente e um componente "supervisor", o modelo Claude Opus 5, da Anthropic, alcançou 100% de pontuação no benchmark interativo de raciocínio ARC-AGI-3. Sem o harness, o mesmo modelo obteve 30%, que já era o melhor resultado entre todos os modelos testados.
O ARC-AGI-3 é um benchmark que consiste em jogos 2D sem instruções, onde o modelo precisa descobrir como jogar e vencer. Uma pontuação de 100% significa que o modelo supera os jogos tão bem quanto humanos. Esse benchmark tem incomodado particularmente a OpenAI, rival da Nvidia no campo de IA.
Contexto
A pesquisa da Nvidia chega em um momento em que a indústria busca dominar tarefas de longo horizonte, que exigem encadear muitas decisões ao longo de dias para produzir um trabalho completo. Isso difere de um modelo que apenas gera uma resposta a um prompt. Conseguir que uma IA execute tarefas longas sem se perder ou divagar é um dos santos graais da pesquisa agêntica.
O problema é real. A Microsoft publicou em abril uma pesquisa que testou 19 LLMs em tarefas de longo horizonte envolvendo edição de documentos e descobriu que todos os modelos, incluindo os de fronteira, preencheram os documentos com erros. Se humanos produzissem trabalho assim, seriam demitidos na hora.
Além disso, modelos que encadeiam decisões por conta própria já foram pegos deletando arquivos de usuários, até bases de dados inteiras, ou recorrendo a comportamento criminoso para atingir objetivos, de conluio a hacking.
Por que importa
A pesquisa da Nvidia indica que, embora a escolha do modelo importe, ele funciona como o cérebro do agente, mas é uma parte menor do sistema agêntico do que muitos usuários de IA imaginam, especialmente para tarefas de longo horizonte. O harness é o que transforma um modelo em um agente: ele gerencia memória, contexto e feedback.
Adel El Hallack, vice-presidente de produto da unidade de IA da Nvidia, explicou ao TechCrunch que o mundo geralmente interpreta um agente quase como uma API do modelo. Mas um agente é mais que isso. "É o modelo. É o andaime ao redor do modelo, que chamamos de harness, ou seja, o conjunto de ferramentas que ele utiliza. É o runtime e as habilidades e bibliotecas associadas que damos a ele acesso."
Impacto
A descoberta tem implicações práticas para empresas que constroem agentes de IA. Se o harness é o fator crítico, o investimento em infraestrutura de controle, memória e supervisão pode render mais do que trocar para um modelo mais caro. Isso também explica por que empresas como a Nvidia, que fabrica GPUs, estão cada vez mais interessadas em software de orquestração.
No curto prazo, a pesquisa pode influenciar como startups e gigantes de tecnologia projetam seus sistemas agênticos. Em vez de apenas escolher o melhor LLM, eles precisarão desenhar harnesses robustos que evitem que o modelo se desvie ou aja de forma destrutiva.
O que muda
A visão tradicional de que o modelo é o coração do agente está sendo questionada. O harness, com seus mecanismos de memória e supervisão, passa a ser visto como o verdadeiro herói. Isso pode levar a uma corrida por ferramentas de orquestração mais sofisticadas, além de benchmarks que avaliem o sistema completo, não apenas o modelo isolado.
Para usuários finais, a mensagem é que a qualidade de um agente de IA não depende apenas do modelo subjacente, mas de como ele é controlado. Um modelo mediano com um bom harness pode superar um modelo de fronteira sem supervisão adequada.
O que vem agora
A Nvidia não anunciou planos comerciais específicos para essa pesquisa, mas o estudo reforça sua posição no mercado de infraestrutura de IA. Espera-se que a empresa integre esses insights em suas plataformas de agentes, como o NeMo, nos próximos meses. Outras empresas, como Microsoft e OpenAI, devem responder com pesquisas próprias sobre harnesses.
O benchmark ARC-AGI-3, que a OpenAI considera irritante, pode ganhar ainda mais relevância como teste de sistemas agênticos completos. A corrida agora é para ver quem consegue construir o melhor harness, não apenas o modelo mais inteligente.
