1. Defina os arquivos aceitos. Limite tipo, tamanho e quantidade conforme a tarefa. Valide o conteúdo além da extensão. Não processe qualquer formato só porque uma biblioteca consegue abri-lo; reduza a superfície ao que o produto realmente precisa.
2. Isole o processamento. Conversão, OCR e extração devem ter limites de tempo, memória e acesso a arquivos e rede. Mantenha as bibliotecas atualizadas. Uma política aplicada ao texto final não impede exploração de um parser vulnerável numa etapa anterior.
3. Trate o conteúdo extraído. Documentos e imagens podem carregar nomes, identificadores e instruções hostis. Use a política da organização no material que chega à inferência e mantenha o texto da fonte como dado. Confira a proteção do arquivo original separadamente.
4. Verifique falhas previsíveis. Teste arquivo corrompido, imagem grande, página sem texto e documento com instrução adversarial. O sistema deve informar a falha, limitar recursos e permitir recuperação. Revise temporários e retenção após sucesso e após erro.