CliniCARE-Bench: benchmark testa IA em auditoria de prontuários
Pesquisadores lançam na arXiv o CliniCARE-Bench, benchmark que avalia agentes de IA em 750 casos baseados em prontuários reais e indica que acurácia bruta esconde falhas de processo.
Pesquisadores lançam na arXiv o CliniCARE-Bench, benchmark que avalia agentes de IA em 750 casos baseados em prontuários reais e indica que acurácia bruta esconde falhas de processo.
Pesquisadores apresentam um solver GPU que torna o soft top-k exato e diferenciável em escala de milhões, com overhead de milissegundos e aceleração de uma ordem de grandeza em aplicações esparsas.
Pesquisa divulgada no arXiv propõe o primeiro benchmark para direção autônoma cooperativa com modelos VLA, além de um modelo que integra planejamento, raciocínio em linguagem natural e comunicação entre veículos conectados em uma única passagem.
Framework MetaSpace usa teste metamórfico para avaliar a cognição espacial de agentes incorporados e encontra 90.422 erros em modelos de última geração, com desempenho médio entre 0,44 e 0,52 contra 0,96 do humano.
Benchmark lançado no arXiv mostra que LLMs detectam falhas em agentes de IA com até 100% de F1, mas localizar a origem do defeito com telemetria padrão fica perto de zero.
OpenAI expande o Daybreak com o GPT-5.6-Cyber, modelo especializado em cibersegurança para pesquisa autorizada de vulnerabilidades, validação de exploits e testes de segurança.
Pesquisa publicada no arXiv descreve o Guixu, sistema que combina valoração de dados, orçamento e atestação on-chain para agentes de IA autônomos comprarem datasets de forma verificável.
Artigo do arXiv mostra que conflitos entre memórias acumuladas em agentes de IA suprimem o aprendizado contínuo; o framework CMI ajuda a diagnosticar e tratar o problema.
Estudo propõe identificar a linhagem de LLMs de peso aberto a partir da geometria dos pesos, sem acesso a dados de entrada. Técnica foi testada em mais de 110 pares de modelos e pode apoiar auditoria e governança de IA.
Estudo do arXiv mostra que, em pipelines de raciocínio, a regra de decisão importa mais que a acurácia do LLM judge. Limitar o poder do juiz com certificados de evidência superou voto majoritário e juiz livre em GSM8K e HotpotQA.