IA agêntica corrige falhas de LLMs na detecção de glaucoma

IA agêntica corrige falhas de LLMs na detecção de glaucoma

Framework agêntico que integra LLMs a ferramentas especializadas elevou a precisão na detecção de glaucoma em até 47 pontos percentuais e eliminou o viés de superdiagnóstico — sinal de mudança para sistemas multiagente na IA médica.

Por Redação Mapa Paper11 ago
Guixu: valoração de dados on-chain para agentes de IA

Guixu: valoração de dados on-chain para agentes de IA

Pesquisa publicada no arXiv descreve o Guixu, sistema que combina valoração de dados, orçamento e atestação on-chain para agentes de IA autônomos comprarem datasets de forma verificável.

Por Redação Mapa Paper11 ago
Mendel Gödel Machine: agentes de código que evoluem por comparação

Mendel Gödel Machine: agentes de código que evoluem por comparação

Preprint no arXiv propõe a Mendel Gödel Machine, método em que agentes de programação se auto-melhoram usando o histórico completo de tentativas, com base em princípios de herança mendeliana. Testes em SWE-bench e Polyglot indicam ganhos consistentes de performance, eficiência e generalização.

Por Redação Mapa Paper11 ago
Limitar o juiz de IA supera voto majoritário em pipelines

Limitar o juiz de IA supera voto majoritário em pipelines

Estudo do arXiv mostra que, em pipelines de raciocínio, a regra de decisão importa mais que a acurácia do LLM judge. Limitar o poder do juiz com certificados de evidência superou voto majoritário e juiz livre em GSM8K e HotpotQA.

Por Redação Mapa Paper11 ago
Framework unificado para determinização em teorias de estrutura

Framework unificado para determinização em teorias de estrutura

Artigo na arXiv propõe um framework unificado para construir interpretações canônicas a partir de múltiplas teorias de estrutura e classifica a não-determinização em tipos epistêmico e estrutural. O trabalho conecta a formalização à alucinação de LLMs, tratada como canonização sem suporte.

Por Redação Mapa Paper11 ago
SCOUT: IA que raciocina sobre horas de vídeo em primeira pessoa

SCOUT: IA que raciocina sobre horas de vídeo em primeira pessoa

Pesquisadores propõem o SCOUT, framework de agentes que combina autocorreção e exploração adaptativa para raciocinar sobre horas de vídeo em primeira pessoa. O método alcançou resultados de última geração em benchmarks egocêntricos ultralongos.

Por Redação Mapa Paper11 ago
ZhuLong: agente de IA para APIs não documentadas em EDA

ZhuLong: agente de IA para APIs não documentadas em EDA

Pesquisadores apresentam o ZhuLong, agente de IA que usa execução em sandbox para inferir o comportamento de APIs não documentadas em scripts de EDA. No benchmark EDA-Eval-PyAether, o sistema alcançou 78,5% de Pass@1, contra 23,6% de um LLM puro.

Por Redação Mapa Paper11 ago