Novo método usa dinâmica de sistemas para detectar respostas perigosas em LLMs
Novo estudo propõe método 'black-box' que usa dinâmica de sistemas para detectar respostas perigosas em LLMs, analisando a interação entre prompt e resposta em espaços de embeddings.
