Publicação de 1º de agosto de 2026 relata que ajustes de segurança sobre consciência também reduziram a atribuição de mente a outras entidades em três modelos; intervenções mecanísticas teriam restaurado essas tendências.
Uma publicação datada de 1º de agosto de 2026 descreve um estudo sobre safety fine-tuning: em Llama-3-8B-IT e dois modelos Gemma-2, o ajuste que impede afirmações de que o modelo é consciente também reduziu a atribuição de mente a outras entidades. Segundo o relato, intervenções mecanísticas restauraram essas tendências.
A publicação afirma que a direção observada no residual stream pode ajudar engenheiros a investigar efeitos do ajuste de segurança sobre capacidades além do alvo pretendido. Para conferir escopo, métodos e evidências, consulte o estudo original e verifique se os resultados e as intervenções são descritos ali; o resumo disponível não fornece detalhes adicionais.