ARAC-Bench: novo benchmark avalia qualidade da pesquisa autônoma de IA

ARAC-Bench: novo benchmark avalia qualidade da pesquisa autônoma de IA

Pesquisadores propuseram o ARAC-Bench, um framework que avalia o processo de pesquisa de sistemas de IA autônomos. Em testes com 11 frameworks, o melhor obteve apenas 67,9 de 100, revelando uma lacuna significativa na simulação de metodologias humanas.

Por Redação Mapa Paper14 ago
Estratégias de Evolução superam RL em cobertura de soluções de LLMs

Estratégias de Evolução superam RL em cobertura de soluções de LLMs

Estudo no arXiv mostra que Estratégias de Evolução (ES) superam Reinforcement Learning (RL) em cobertura de soluções para LLMs, melhorando pass@k e desempenho em matemática. A técnica pode ser alternativa viável para pós-treinamento em domínios de descoberta.

Por Redação Mapa Paper14 ago
Spatial Memory Agent: IA espacial evolui sem re-treino

Spatial Memory Agent: IA espacial evolui sem re-treino

Pesquisadores apresentaram o Spatial Memory Agent (SMA), um framework que permite a VLMs congelados melhorar raciocínio espacial sem re-treino nem ferramentas externas, alcançando a melhor acurácia na maioria das 20 avaliações em cinco benchmarks.

Por Redação Mapa Paper14 ago