Pular para o conteúdo
Rota Nacional

Radar ·

Estudo liga safety tuning à atribuição de mente

Publicação de 1º de agosto de 2026 relata que ajustes de segurança sobre consciência também reduziram a atribuição de mente a outras entidades em três modelos; intervenções mecanísticas teriam restaurado essas tendências.

Uma publicação datada de 1º de agosto de 2026 descreve um estudo sobre safety fine-tuning: em Llama-3-8B-IT e dois modelos Gemma-2, o ajuste que impede afirmações de que o modelo é consciente também reduziu a atribuição de mente a outras entidades. Segundo o relato, intervenções mecanísticas restauraram essas tendências.

A publicação afirma que a direção observada no residual stream pode ajudar engenheiros a investigar efeitos do ajuste de segurança sobre capacidades além do alvo pretendido. Para conferir escopo, métodos e evidências, consulte o estudo original e verifique se os resultados e as intervenções são descritos ali; o resumo disponível não fornece detalhes adicionais.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis