Jailbreak em modelos de difusão: estudo mapeia barreira de energia
Paper no arXiv trata o alinhamento de segurança de modelos de difusão como uma barreira de energia e deriva três sinais de detecção sem treinamento. Nos testes com LLaDA-8B, LLaDA-1.5, Dream-7B e LLaDA-MoE-7B, todo ataque que escapou da detecção também falhou em gerar conteúdo nocivo.
