SAGE: framework de IA aprende a criar storyboards e supera profissionais
Framework SAGE cria storyboards automáticos que superam diretores humanos em teste, reduzindo 83% do tempo de autoria e sendo aceito em 87% dos casos na produção real.
Framework SAGE cria storyboards automáticos que superam diretores humanos em teste, reduzindo 83% do tempo de autoria e sendo aceito em 87% dos casos na produção real.
Pesquisa publicada no arXiv propõe o SIRLM, um novo modelo para corrigir o "drift" de raciocínio de LLMs em Knowledge Graphs. O método acopla regras estruturais à lógica da IA, testado em 36 datasets.
Pesquisa do arXiv propõe algoritmo que inicia com acesso mínimo a recursos para agentes de IA, expandindo apenas após falha. Em testes, reduziu em 48% o consumo de tokens em tarefas de data center.
Novo framework LEGO-RL melhora o desempenho do modelo Qwen em até 9,4% em benchmarks de código, resolvendo problemas de alinhamento em ambientes de execução.
Pesquisadores propõem GraphGAN, que usa grafos e GANs para detectar DDoS com mais precisão, especialmente quando há poucos dados de ataques.
Estudo do arXiv mostra que LLMs de código aberto superam métodos tradicionais em corrigir erros em modelos de IA, mas sua taxa de sucesso cai drasticamente em testes complexos, impedindo a automação confiável.
TileMix é um novo kernel que roteia precisão numérica por blocos para acelerar LLMs em textos longos, recuperando qualidade perdida em métodos anteriores.
Pesquisa do arXiv revela que modelos de linguagem são testados com problemas médicos já claros, mas falham quando o paciente inicia a conversa com queixas vagas — um defeito crítico para a adoção clínica segura.
Novo framework open-source e benchmark com 350 tarefas reais buscam resolver o problema de agentes de IA que falham ao operar na web do mundo real por longos períodos.
Estudo revela que um modelo de linguagem de 3 bilhões de parâmetros, após fine-tuning, atinge 39,12% de acurácia em problemas de raciocínio matemático para sinais, triplicando o desempenho original.