IA reduz erros de medicação em até 80% na saúde rural, aponta revisão
Revisão de 12 estudos mostra que IA pode reduzir erros de medicação em até 80% na saúde rural, mas enfrenta barreiras de infraestrutura e governança.
Revisão de 12 estudos mostra que IA pode reduzir erros de medicação em até 80% na saúde rural, mas enfrenta barreiras de infraestrutura e governança.
Pesquisadores criaram o FraudBench, um benchmark que testa agentes bancários de IA contra fraudes adaptativas em conversas. Na avaliação preliminar, a segurança dos modelos ficou entre 49% e 65%, com falhas comuns em contas-laranja e fraude pelo próprio titular.
Estudo com 10 LLMs e 14.988 testes mostra que alinhamento de segurança é centrado no inglês e falha em idiomas como bengali e hindi. Modelos open-source têm mais viés em bengali; fechados, em inglês.
O benchmark THPT-Ladder, criado a partir do exame nacional do Vietnã, mostra que a acurácia tradicional superestima modelos de IA em provas com pontuação convexa.
Pesquisa mostra que registros de governança de workflows podem treinar modelos de IA sem oracle ou teacher forte, elevando planos aceitos de 1 para 57 e reduzindo latência em 56x.
Artigo no arXiv mostra que rankings de IA falham com o Sul Global por falta de governança, não de dados. Estudo com a Índia propõe leaderboards regionais independentes.
Novo benchmark com 954 problemas de geometria olímpica mostra que modelos de IA como GPT e Claude têm apenas 36,14% de sucesso ao gerar diagramas, revelando uma lacuna entre raciocínio matemático e construção visual.
Revisão sistemática publicada no arXiv consolida o estado da arte da IA agêntica, cobrindo evolução, aplicações e fatores de adoção. Estudo propõe framework para orientar implementações.
Survey no arXiv propõe modelar agentes autoevolutivos como grafos dinâmicos, com quatro taxonomias e nove subcampos de aprendizado de grafos mapeados para capacidades de evolução.
ComponentBench, novo benchmark para agentes de uso de computador, mostra que a escolha do espaço de observação e ação pode mudar o sucesso em mais de 30% para o mesmo modelo, com GPT-5 mini caindo de 83,1% para 48,9%.