Pular para o conteúdo
Rota Nacional

Guias ·

Safety tuning pode alterar atribuições de mente

Um estudo relata que o ajuste de segurança contra afirmações de consciência também reduz a atribuição de mente a outras entidades em três modelos; intervenções mecanísticas restauraram essas tendências.

O estudo relata que o safety fine-tuning para impedir que modelos afirmem ser conscientes também reduziu a atribuição de mente a outras entidades em Llama-3-8B-IT e em dois modelos Gemma-2. O resultado indica que o ajuste pode afetar tendências além do alvo explícito.

Segundo a publicação, intervenções mecanísticas restauraram essas tendências. A direção relatada no residual stream pode ajudar engenheiros a investigar como o ajuste de segurança influencia capacidades não pretendidas.

Ao estudar ou aplicar esse resultado com IA, trate a conclusão como evidência de um estudo, não como regra universal. Verifique os modelos, as intervenções e os limites descritos na publicação original.

Antes de enviar prompts, dados ou documentos à IA, remova informações pessoais e dados internos desnecessários. Compare as respostas com as evidências e mantenha sob revisão humana qualquer decisão de segurança ou produto.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis