SteerBench-Work: benchmark avalia decisões de agentes de IA

SteerBench-Work: benchmark avalia decisões de agentes de IA

Benchmark SteerBench-Work revela que agentes de IA seguram indevidamente 28,1% do trabalho autorizado, enquanto permitem apenas 1,0% de ações inseguras. Estudo aponta que capacidade geral não garante calibração de decisões.

Por Redação Mapa Paper14 ago
@skills: protocolo propõe usar habilidades sem instalar

@skills: protocolo propõe usar habilidades sem instalar

Protocolo @skills propõe usar habilidades de agentes de IA sem instalação, separando conteúdo, persistência e gatilho automático. Com 56.804 habilidades públicas, a abordagem promete liberar o prompt do sistema e facilitar a adoção da cauda longa.

Por Redação Mapa Paper14 ago
DiG-bench: benchmark de IA para descoberta em jogos

DiG-bench: benchmark de IA para descoberta em jogos

Pesquisadores lançaram o DiG-bench, um benchmark com 70 jogos independentes que testam a capacidade de modelos de IA de descobrir regras por experimentação. O conjunto, disponível no arXiv, tem sete níveis de dificuldade e foi resolvido por humanos na primeira tentativa.

Por Redação Mapa Paper14 ago