Um estudo relata que o ajuste de segurança contra afirmações de consciência também reduz a atribuição de mente a outras entidades em três modelos; intervenções mecanísticas restauraram essas tendências.
O estudo relata que o safety fine-tuning para impedir que modelos afirmem ser conscientes também reduziu a atribuição de mente a outras entidades em Llama-3-8B-IT e em dois modelos Gemma-2. O resultado indica que o ajuste pode afetar tendências além do alvo explícito.
Segundo a publicação, intervenções mecanísticas restauraram essas tendências. A direção relatada no residual stream pode ajudar engenheiros a investigar como o ajuste de segurança influencia capacidades não pretendidas.
Ao estudar ou aplicar esse resultado com IA, trate a conclusão como evidência de um estudo, não como regra universal. Verifique os modelos, as intervenções e os limites descritos na publicação original.
Antes de enviar prompts, dados ou documentos à IA, remova informações pessoais e dados internos desnecessários. Compare as respostas com as evidências e mantenha sob revisão humana qualquer decisão de segurança ou produto.