Avaliação de IA deve trabalhar com humanos, diz paper
Um paper na arXiv propõe que a avaliação de IA deve focar em equipes humano-máquina, em vez de desempenho super-humano, para melhores resultados sociais.
Um paper na arXiv propõe que a avaliação de IA deve focar em equipes humano-máquina, em vez de desempenho super-humano, para melhores resultados sociais.
O Agentao é um runtime open-source que separa propostas de ação de execução autorizada para agentes LLM, focando em governança e segurança local-first. Publicado no arXiv, o código está disponível no GitHub.
Pesquisa publicada no arXiv liberara trace completa de um ano de tráfego de LLMs da plataforma Chutes, revelando padrões ocultos de uso e modelos populares e de nicho para impulsionar a próxima geração de sistemas de servimento.
Estudo do arXiv analisou 46 tarefas e descobriu que LLMs criam módulos cognitivos distintos, espelhando a organização funcional do cérebro humano, o que aponta para uma propriedade fundamental da inteligência.
Pesquisa revela que camadas tardias de modelos Mixture-of-Experts como o Qwen3.6 toleram desativação agressiva de centenas de experts sem perda de qualidade, abrindo caminho para LLMs menores e mais eficientes.
RubricForge reduz a taxa de falsos positivos na avaliação de agentes IA em até 33%, tornando julgamentos automáticos mais confiáveis sem depender de recompensas externas.
O DeepSeek V4 Flash lidera benchmarks, mas completou apenas 53,8% das tarefas reais em testes da Composio. A DeepSeek também aumentou os preços do V4 Flash e V4 Pro, sinalizando mudança de estratégia.
A Z.ai lançou o GLM-5.3, modelo com avanços em codificação e cibersegurança que já encontrou uma vulnerabilidade grave no Cursor. Pesos abertos só saem após avaliação de segurança.
DECAF decompõe respostas de IA em evidência, contradição e fragilidade, acertando 96,4% dos casos onde a magnitude acerta apenas 35%.
Pesquisadores propõem o DMDIntel, método que usa dynamic mode decomposition para ranquear tokens em LLMs. Em testes, superou SHAP, integrated gradients e PCA em tarefas de classificação.